跳到正文

全部动态

今日 11 条
8月13日周四
  1. OpenAI News60

    OpenAI 预览 Ultrafast 模式:GPT-5.6 Sol 速度提升至 14 倍

    OpenAI 推出新的 API 服务层级 Ultrafast,使 GPT-5.6 Sol 模型的运行速度最高提升 14 倍。该服务由 Cerebras 提供支持,可实现每秒高达 750 个输出 token 的速度。

    推荐理由:官方预览了基于 Cerebras 的 Ultrafast 服务层级,展示了 GPT-5.6 Sol 模型在速度上的显著提升及具体 token 生成指标。

  2. Hugging Face Blog44

    OlmoEarth Studio 支持导出自定义嵌入向量用于下游分析

    OlmoEarth Studio 新增功能,允许用户计算并导出由开源 OlmoEarth 基础模型生成的嵌入向量。该功能提供 Nano、Tiny 和 Base 三种编码器变体,支持通过 UI 或 API 选择区域、时间范围及影像源,输出为 Cloud-Optimized GeoTIFFs (COGs)。这些轻量级向量适用于相似性搜索、分割等下游任务,且源码与权重已公开。

  3. Microsoft Research35

    MindTopo 基准揭示 VLMs 拓扑推理与规划能力差距

    Microsoft Research 推出 MindTopo 基准,评估多模态大模型在连续性、分离性、顺序、包围和结等拓扑概念上的理解能力。测试显示当前模型在静态图像识别上表现优于交互式规划任务,且整体性能远低于人类水平。这一发现表明模型难以在动作序列中维持一致的拓扑理解,为机器人及交互环境中的可靠决策提供了改进方向。

8月12日周三
  1. Google Research60

    Google Research 提出知识画像框架:检索是参数化事实性的瓶颈

    Google Research 引入“知识画像”行为框架和 WikiProfile 基准,区分大语言模型中的事实编码与检索能力。研究发现 Gemini-3-Pro 和 GPT-5 等前沿模型的事实编码率高达 95–98%,但仍有 26–34% 的已编码事实无法直接检索,表明事实性错误的瓶颈已从知识获取转向知识利用。

    推荐理由:原文提出知识画像框架并构建 WikiProfile 基准,揭示前沿模型事实性错误主要源于检索失败而非编码缺失,为优化模型知识利用率提供新视角。

  2. Microsoft Research42

    Microsoft Research 发布 CARE-X:结合辅助监督与强化学习的临床放射学 VLM

    Microsoft Research 推出研究模型 CARE-X,这是一个用于胸部 X 光解读的统一视觉语言模型。该模型结合生成式与判别式能力,利用 DAPO 强化学习优化临床正确性,并支持确定性测量工具以处理依赖精确测量的病症。CARE-X 已在 Narayana Health 的真实世界印度临床数据上进行验证,旨在提供兼具自由文本推理与校准诊断预测的灵活输出。

8月11日周二
  1. Mistral AI50

    Mistral 推出区域推理端点、优先层级并支持 GLM-5.2 等第三方开源模型

    Mistral 正式推出 Mistral Regional Endpoints 和处于公开预览阶段的 Mistral Priority Tier,提供欧洲或美国区域选择及 SLA 保障。平台开始支持 Z.ai 的 GLM-5.2 等第三方开源模型,使其运行于相同的区域控制与服务承诺下。Mistral 还组建联盟锁定长期算力,计划到 2030 年建成高达 1 GW 容量以强化 AI 主权。

  2. OpenAI News60

    OpenAI 发布新产品更新

    OpenAI 官方新闻源发布了新的产品更新信息。具体功能细节未在标题中展开,需查阅原文获取完整说明。

    推荐理由:OpenAI 官方发布新产品动态,读者可据此了解其最新功能变化及潜在影响。

  3. Hugging Face Blog62

    NVIDIA 发布 Magpie Multilingual TTS:支持12种语言的开源低延迟语音合成模型

    NVIDIA 发布 Magpie Multilingual TTS,这是一个364M参数的开源权重多语言文本转语音模型,最新支持包括阿拉伯语、韩语和巴西葡萄牙语在内的12种语言。

    推荐理由:原文给出了 Magpie TTS 新增语言、低延迟实测数据及开源权重部署细节,为构建可控的多语言语音智能体提供了具体参考。

8月10日周一
  1. Hugging Face Blog42

    Hugging Face 提出高效知识蒸馏方案,大幅降低 LLM 训练显存需求

    Hugging Face 推出离线 Top-K Logits 缓存与融合分块 KL 损失技术,解决大模型知识蒸馏的高显存痛点。该方法避免同时加载教师与学生模型及构建全词表矩阵,将单步训练峰值显存从约 250GB 降至 128GB。这一优化使长上下文修复可在单张 GPU 上运行,显著降低了大规模实验的成本门槛。

  2. Hugging Face Blog92

    Meta 发布 Muse Glimmer:面向本地智能体的开源多模态模型

    Meta 发布 Muse Glimmer,这是一个专为本地智能体用例设计的 30B 参数多模态模型,采用 Apache 2.0 许可证开源。该模型由 Muse 蒸馏而来,包含 2B ViT 视觉编码器和 28B 文本解码器,支持图像、视频输入及多模态工具调用。

    推荐理由:原文给出了30B参数模型的架构细节、基准测试数据及在主流推理框架中的Day-0支持,读者可据此评估其在本地智能体场景下的实际部署能力。

8月7日周五
8月6日周四
  1. OpenAI News66

    OpenAI 发布新产品功能

    OpenAI 发布了新的产品功能。该更新涉及具体的能力变化和开放入口。

    推荐理由:OpenAI官方发布新产品功能,用户可了解具体能力变化及开放入口。

8月5日周三
8月4日周二
  1. Mistral AI73

    Mistral AI 发布 Shieldstral:3B 参数开源多模态安全分类器

    Mistral AI 发布 Shieldstral,这是一款 3B 参数的开源多模态安全分类器,在文本安全方面性能匹敌或超越体积达其 7 倍的模型,并在多模态审核基准上创下新纪录。

    推荐理由:原文展示了将内容审核转化为问答任务的新范式,读者可据此了解如何通过自然语言策略实现无需重训的灵活安全评估。

7月31日周五
  1. Google Research65

    Google Research 提出 Science One Framework:通过 Chain-of-Evidence 实现可验证的自主科研

    Google Research 发布论文提出 Chain-of-Evidence (CoE) 框架及 Science One Framework 原型,旨在解决 AI 自主科研中的可验证性问题。该框架通过构建原生证据链,实现了零幻影引用和完全可验证的评分,同时在 MLE-Bench 和 Parameter-Golf 等前沿基准测试中达到 SOTA 性能。

    推荐理由:原文提出了基于证据链的可验证性框架,展示了在消除幻觉引用同时保持前沿基准性能的方法。

7月30日周四
  1. Google DeepMind76

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,这是一款用于机器人的高级具身推理模型。该模型支持视频理解、任务编排和多机器人协作,在进度分类和时刻查找任务中分别达到 57.4% 和 91.3% 的准确率。开发者可通过 Gemini API 和 Google AI Studio 访问该模型。

    推荐理由:原文给出了视频理解、任务编排和多机器人协作的具体能力指标,读者可以据此判断其在物理世界中的实际表现。