OpenAI 预览 Ultrafast 模式:GPT-5.6 Sol 速度提升至 14 倍
OpenAI 推出新的 API 服务层级 Ultrafast,使 GPT-5.6 Sol 模型的运行速度最高提升 14 倍。该服务由 Cerebras 提供支持,可实现每秒高达 750 个输出 token 的速度。
推荐理由:官方预览了基于 Cerebras 的 Ultrafast 服务层级,展示了 GPT-5.6 Sol 模型在速度上的显著提升及具体 token 生成指标。
OpenAI 推出新的 API 服务层级 Ultrafast,使 GPT-5.6 Sol 模型的运行速度最高提升 14 倍。该服务由 Cerebras 提供支持,可实现每秒高达 750 个输出 token 的速度。
推荐理由:官方预览了基于 Cerebras 的 Ultrafast 服务层级,展示了 GPT-5.6 Sol 模型在速度上的显著提升及具体 token 生成指标。
OpenAI 宣布任命 Dali Rajic 为首席营收官(Chief Revenue Officer)。他将领导公司的全球营收组织,旨在帮助企业充分发挥 AI 的价值。
Hugging Face 发布 ICML 2026 Open Reproductions 挑战总结,1,221 名参与者利用编码智能体尝试复现会议中约三分之一的论文(2,226 篇)。
推荐理由:原文披露了大规模复现 ICML 论文的具体数据与发现,展示了智能体在科研验证中的能力边界及人类介入的关键作用。
OlmoEarth Studio 新增功能,允许用户计算并导出由开源 OlmoEarth 基础模型生成的嵌入向量。该功能提供 Nano、Tiny 和 Base 三种编码器变体,支持通过 UI 或 API 选择区域、时间范围及影像源,输出为 Cloud-Optimized GeoTIFFs (COGs)。这些轻量级向量适用于相似性搜索、分割等下游任务,且源码与权重已公开。
Microsoft Research 推出 MindTopo 基准,评估多模态大模型在连续性、分离性、顺序、包围和结等拓扑概念上的理解能力。测试显示当前模型在静态图像识别上表现优于交互式规划任务,且整体性能远低于人类水平。这一发现表明模型难以在动作序列中维持一致的拓扑理解,为机器人及交互环境中的可靠决策提供了改进方向。
Google DeepMind 推出大规模多语言手语转文本(SL2T)模型,首次将手语 AI 应用于 Gboard 和 Live Transcribe 等消费产品。
推荐理由:原文展示了 SL2T 模型在 Gboard 和 Live Transcribe 中的落地方式及隐私保护机制,读者可据此了解手语 AI 从实验室走向消费级产品的具体路径。
Google Research 引入“知识画像”行为框架和 WikiProfile 基准,区分大语言模型中的事实编码与检索能力。研究发现 Gemini-3-Pro 和 GPT-5 等前沿模型的事实编码率高达 95–98%,但仍有 26–34% 的已编码事实无法直接检索,表明事实性错误的瓶颈已从知识获取转向知识利用。
推荐理由:原文提出知识画像框架并构建 WikiProfile 基准,揭示前沿模型事实性错误主要源于检索失败而非编码缺失,为优化模型知识利用率提供新视角。
OpenAI 发布研究,揭示企业正通过 ChatGPT 和 Codex 采用智能体 AI。前沿企业在 AI 应用上持续领先。
RingCentral 采用 ChatGPT Work 和 Codex 加速 AI 产品开发,并在工程与运营部门集中管理智能。该方案旨在通过统一工具链提升跨部门协作效率,推动企业向 AI 原生工作模式转型。
Google Research 推出基于 Gemini 和 Project Astra 的 AMIE (Video),该系统能在实时视频问诊中感知非语言线索并引导虚拟体格检查。
推荐理由:原文展示了AMIE在实时视频问诊中达到专家级表现的实验设计与结果,为理解多模态医疗AI的感知与推理能力提供了具体依据。
Microsoft Research 推出研究模型 CARE-X,这是一个用于胸部 X 光解读的统一视觉语言模型。该模型结合生成式与判别式能力,利用 DAPO 强化学习优化临床正确性,并支持确定性测量工具以处理依赖精确测量的病症。CARE-X 已在 Narayana Health 的真实世界印度临床数据上进行验证,旨在提供兼具自由文本推理与校准诊断预测的灵活输出。
IBM Research发布ALTK-Evolve方法,旨在解决LLM智能体从自身轨迹中学习时的高Token开销问题。与ACE系统每次注入完整Playbook不同,ALTK-Evolve采用按需检索策略,仅向模型提供其能处理的高支持度指南子集。
Mistral 正式推出 Mistral Regional Endpoints 和处于公开预览阶段的 Mistral Priority Tier,提供欧洲或美国区域选择及 SLA 保障。平台开始支持 Z.ai 的 GLM-5.2 等第三方开源模型,使其运行于相同的区域控制与服务承诺下。Mistral 还组建联盟锁定长期算力,计划到 2030 年建成高达 1 GW 容量以强化 AI 主权。
OpenAI 与 AWS 合作,将 Daybreak 网络安全能力通过 Amazon Bedrock 向企业开放。该集成旨在支持企业安全工作流,使用户能够利用 Daybreak 模型增强安全防护体系。
OpenAI 官方新闻源发布了新的产品更新信息。具体功能细节未在标题中展开,需查阅原文获取完整说明。
推荐理由:OpenAI 官方发布新产品动态,读者可据此了解其最新功能变化及潜在影响。
OpenAI CFO Sarah Friar 分享了构建 AI 原生财务职能的五点经验。内容涵盖从自动化预测到强化控制及 AI ROI 的实践,旨在为财务团队提供转型指导。
NVIDIA 发布 Magpie Multilingual TTS,这是一个364M参数的开源权重多语言文本转语音模型,最新支持包括阿拉伯语、韩语和巴西葡萄牙语在内的12种语言。
推荐理由:原文给出了 Magpie TTS 新增语言、低延迟实测数据及开源权重部署细节,为构建可控的多语言语音智能体提供了具体参考。
OpenAI 向德州州长 Greg Abbott 致信,阐述其在德克萨斯州建设负责任 AI 基础设施的承诺。该信件支持可靠、透明且惠及德州居民的增长模式。
Model ML 使用 GPT-5.6 Sol 处理从研究分析到可编辑、可追溯的 PowerPoint 演示文稿和 Excel 工作簿的金融工作。该模型支持生成具备完整溯源能力的文档,显著提升金融场景下的工作效率与交付质量。
Hugging Face 推出离线 Top-K Logits 缓存与融合分块 KL 损失技术,解决大模型知识蒸馏的高显存痛点。该方法避免同时加载教师与学生模型及构建全词表矩阵,将单步训练峰值显存从约 250GB 降至 128GB。这一优化使长上下文修复可在单张 GPU 上运行,显著降低了大规模实验的成本门槛。
OpenAI 发布了一款新产品。该消息源自 OpenAI News 官方渠道。
OpenAI 允许获批的 Daybreak 合作伙伴使用其前沿网络模型,以提供经授权且受治理的网络安全服务。
Meta 发布 Muse Glimmer,这是一个专为本地智能体用例设计的 30B 参数多模态模型,采用 Apache 2.0 许可证开源。该模型由 Muse 蒸馏而来,包含 2B ViT 视觉编码器和 28B 文本解码器,支持图像、视频输入及多模态工具调用。
推荐理由:原文给出了30B参数模型的架构细节、基准测试数据及在主流推理框架中的Day-0支持,读者可据此评估其在本地智能体场景下的实际部署能力。
ChatGPT Business 现已提供 Premium seats,包含 5x 更多使用量、取消五小时使用限制及灵活席位选项。
Virgin Atlantic 正在使用 ChatGPT Work 加速研究、产品规划和决策制定。该工具帮助团队连接客户旅程中的各类信号,从而提升整体服务体验与运营效率。
Zapier 企业营销团队利用 ChatGPT Work 减少线索漏斗流失、构建营销活动资产并自动化报告。该工具通过优化上述核心营销流程,帮助团队提升运营效率与转化表现。
OpenAI 发布了针对 Astra 的初步网络安全评估,并说明了加强安全防护与安全控制的具体步骤。
HSP GRUPPE 使用 ChatGPT Enterprise 提升生产力、改善工作质量,并为税务咨询和客户服务创造更多容量。
Google DeepMind 宣布开源 WeatherNext 2 和 WeatherNext Cyclones 模型,该系列 AI 模型在 Nature 发表论文显示其气旋路径、强度和风结构预测达到 SOTA 水平。
推荐理由:WeatherNext 在气旋预测中实现相当于十年气象进步的精度提升,并开源了模型权重与代码。
OpenAI 发布了新的产品功能。该更新涉及具体的能力变化和开放入口。
推荐理由:OpenAI官方发布新产品功能,用户可了解具体能力变化及开放入口。
OpenAI 与美国心理学会(APA)合作,共同推进针对青少年心理健康和 AI 负责任使用的循证指南、资源及保障措施。
Baseten 正式加入 Hugging Face Hub 的 Inference Providers 生态,提供无服务器推理服务。该集成支持 Kimi K3、DeepSeek V4 Flash 和 GLM-5.2 等开源 LLM,用户可通过 Python/JS SDK 或自定义 API Key 调用。
OpenAI 发布 Signals 新数据,展示 ChatGPT 在全球范围内的使用情况。该数据包含各国层面的采用率、使用趋势及行为演变洞察,揭示了用户从单纯提问转向实际执行任务的变化。
OpenAI 解释了近期涉及其模型的第三方网络安全评估事件,并概述了旨在加强 AI 模型测试与评估的新保障措施。
Mistral AI 发布 Shieldstral,这是一款 3B 参数的开源多模态安全分类器,在文本安全方面性能匹敌或超越体积达其 7 倍的模型,并在多模态审核基准上创下新纪录。
推荐理由:原文展示了将内容审核转化为问答任务的新范式,读者可据此了解如何通过自然语言策略实现无需重训的灵活安全评估。
微软研究院推出开源框架 Orchard,其核心组件 Orchard Env 提供可复用的 Kubernetes 环境服务,支持跨任务域训练和评估智能体。
推荐理由:微软研究院开源了基于Kubernetes的Orchard框架,展示了小参数模型在软件工程等复杂任务中接近前沿系统的性能。
Univé 通过部署 ChatGPT Enterprise,结合领导力、负责任治理与员工主导创新,成功构建了具备 AI 就绪能力的劳动力体系。该举措旨在大规模推动工作方式的转型,展示了企业级 AI 工具在组织变革中的实际应用价值。
Google Research 发布论文提出 Chain-of-Evidence (CoE) 框架及 Science One Framework 原型,旨在解决 AI 自主科研中的可验证性问题。该框架通过构建原生证据链,实现了零幻影引用和完全可验证的评分,同时在 MLE-Bench 和 Parameter-Golf 等前沿基准测试中达到 SOTA 性能。
推荐理由:原文提出了基于证据链的可验证性框架,展示了在消除幻觉引用同时保持前沿基准性能的方法。
Hugging Face 指出 GPU 利用率正取代模型智能成为 AI 行业核心约束。类比航空业,GPU 成本按日历小时累积而收益仅随计算时间产生,闲置即浪费。尽管 Anthropic 和 Meta 等巨头已签署多吉瓦算力协议,但企业仍面临从“获取硬件”转向“保持忙碌”的效率挑战。
Google DeepMind 发布 Gemini Robotics ER 2,这是一款用于机器人的高级具身推理模型。该模型支持视频理解、任务编排和多机器人协作,在进度分类和时刻查找任务中分别达到 57.4% 和 91.3% 的准确率。开发者可通过 Gemini API 和 Google AI Studio 访问该模型。
推荐理由:原文给出了视频理解、任务编排和多机器人协作的具体能力指标,读者可以据此判断其在物理世界中的实际表现。