跳到正文

全部动态

今日 42 条
2月1日周日
1月30日周五
  1. Google DeepMind78

    Google DeepMind 向美国 AI Ultra 用户推出 Project Genie 交互世界原型

    Google DeepMind 即日起向美国 Google AI Ultra 订阅用户(18+)推出实验性研究原型 Project Genie。该应用由 Genie 3、Nano Banana Pro 和 Gemini 驱动,支持通过文本或图像提示创建、探索及混剪可交互的沉浸式世界,并能在移动时实时生成前方路径。

    推荐理由:官方开放了基于 Genie 3 的交互式世界原型,明确了实时生成路径与物理模拟的能力边界及当前限制。

1月29日周四
  1. Hugging Face Blog65

    Hugging Face 发布开源 Python 库 Daggr:代码驱动 AI 工作流与可视化调试

    Hugging Face 推出开源 Python 库 Daggr,允许开发者通过代码构建连接 Gradio 应用、ML 模型和自定义函数的 AI 工作流。该工具自动生成交互式可视化画布,支持检查中间输出、单独重跑步骤及管理状态,旨在解决复杂管道调试难的问题。

    推荐理由:原文介绍了 Daggr 如何通过代码定义工作流并自动生成可视化画布,为开发者提供了调试多步 AI 管道的轻量级方案。

1月28日周三
  1. OpenAI News24

    OpenAI 发布欧盟经济蓝图 2.0

    OpenAI 推出欧盟经济蓝图 2.0,旨在通过新数据、合作伙伴关系及倡议加速欧洲范围内的 AI 采用、技能提升与经济增长。该计划聚焦于推动 AI 技术在欧洲的普及与应用,以支持区域经济发展。

  2. Hugging Face Blog64

    Hugging Face 发布 upskill 工具:用 Claude 生成 CUDA 内核技能并赋能开源小模型

    Hugging Face 推出 `upskill` 工具,通过让 Claude Opus 4.5 等前沿模型解决复杂任务(如编写 CUDA kernels)来生成 Agent Skills,并将这些技能文件迁移给更便宜或本地的开源模型使用。

    推荐理由:原文演示了利用大模型生成 CUDA 内核技能并迁移至小模型的完整流程,提供了可复用的 upskill 工具链与评估方法。

  3. Google Research40

    Google Research 提出 ATLAS:面向多语言模型的自适应迁移缩放定律

    Google Research 发布 ATLAS,基于 774 次训练、10M–8B 参数模型及 400+ 种语言数据,提出自适应迁移缩放定律以优化多语言预训练。该研究量化了语言间协同效应,指出支持两倍语言数量需将模型规模扩大 1.18 倍、数据量增加 1.66 倍。ATLAS 为构建者提供了平衡语言混合与模型效率的数据驱动指南,并在 ICLR 2026 展示。

  4. Mistral AI68

    Mistral 发布 Vibe 2.0 终端编码智能体及 Devstral 2 模型更新

    Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的重大升级,由 Devstral 2 模型家族驱动。新版本支持构建自定义子代理、执行前多选项澄清、通过斜杠命令加载技能以及统一代理模式,并包含自动更新功能。

    推荐理由:Mistral Vibe 2.0 引入自定义子代理和斜杠命令技能,配合 Devstral 2 模型升级,为终端原生编码提供了更灵活的工作流配置。

1月27日周二
  1. Hugging Face Blog27

    Alyah 基准发布:评估阿拉伯大语言模型阿联酋方言能力

    Hugging Face 团队推出 Alyah 基准,专门评估阿拉伯大语言模型对阿联酋方言的语言、文化及语用理解能力。该数据集包含 1,173 个由母语者手工收集的样本,涵盖问候、诗歌及历史知识等类别。研究测试了 54 个模型,结果显示 google/gemma-3-27b-pt 在基础模型中表现最佳,准确率达 74.68%。

  2. OpenAI News18

    PVH 采用 ChatGPT Enterprise 重塑时尚未来

    Calvin Klein 和 Tommy Hilfiger 母公司 PVH Corp. 正式采用 ChatGPT Enterprise,将 AI 技术引入时尚设计、供应链管理及消费者互动环节。这一举措标志着传统时尚巨头通过企业级大模型工具加速数字化转型,旨在优化从创意到市场的全链路效率。

  3. Hugging Face Blog42

    GPT-OSS 智能体强化学习训练实践回顾

    Hugging Face 团队验证了 GPT-OSS 在智能体强化学习中的适用性,指出其此前仅用于无工具调用的微调。实验发现 MoE 架构下的双前向传播导致对数概率不匹配,引发 KL 散度爆炸。通过修复 PPO 在线策略完整性,该方案成功支持 GPT-OSS-20B 及 120B 模型进行多步交互训练。

1月26日周一
1月24日周六
1月23日周五
1月22日周四
  1. Mistral AI62

    Mistral AI 分享 vLLM 内存泄漏调试深度解析

    Mistral AI 团队发布工程深度剖析文章,记录了在 vLLM 部署 Mistral Medium 3.1 模型时遭遇的内存泄漏排查过程。该问题仅在启用 Prefill/Decode 分离服务和 NIXL 传输时出现,表现为系统内存以每分钟 400 MB 的速度线性增长。

    推荐理由:详细记录了从 Python 层到内核层的内存泄漏排查过程,展示了在复杂依赖栈中定位隐蔽问题的具体工具链与方法。

1月21日周三
  1. Hugging Face Blog38

    Hugging Face 发布 AssetOpsBench:面向工业资产管理的多智能体基准

    Hugging Face 推出 AssetOpsBench,专为工业资产管理场景设计,包含 2.3M 传感器遥测点、140+ 场景及 53 种结构化故障模式。该基准通过六个定性维度评估多智能体协作能力,重点考察决策轨迹质量与故障意识。其 TrajFM 管道结合 LLM 推理与统计聚类,自动发现并分析代理执行中的失败模式,提供可解释的反馈以优化工业 AI 智能体表现。

1月20日周二
  1. Hugging Face Blog53

    Hugging Face 回顾 DeepSeek R1 发布一周年:开源生态的战略转变与全球回响

    Hugging Face 发布博客回顾 DeepSeek R1 推出一年以来对中国及全球开源 AI 生态的影响。R1 通过 MIT 许可和开放推理路径降低了技术、采用和心理三重壁垒,促使百度、字节等大厂大幅增加开源发布,并将竞争焦点从单一模型性能转向生态系统与基础设施。数据显示,2025 年中国新创模型的下载量已超越美国,且西方社区在寻求商业部署替代方案时,也频繁基于或参考中国开源模型进行开发。