跳到正文

全部动态

今日 40 条
11月24日周一
11月22日周六
11月21日周五
  1. Hugging Face Blog45

    Hugging Face TRL 集成 RapidFire AI,微调实验速度提升约 20 倍

    Hugging Face TRL 正式集成 RapidFire AI,通过自适应分块并发训练将微调实验吞吐量提升约 16–24 倍。用户可使用 RFSFTConfig 等零代码替换配置,在单 GPU 上并发比较多个 LLM 微调方案。该工具提供实时仪表盘与交互式控制操作,支持动态停止、克隆及修改运行中的任务以优化资源利用。

11月20日周四
  1. Google DeepMind63

    Google DeepMind 在 Gemini 应用中推出 AI 图像验证功能

    Google DeepMind 宣布在 Gemini 应用中引入 AI 图像验证功能,用户可通过上传图像询问是否由 Google AI 生成或编辑。该功能基于 SynthID 数字水印技术,结合模型推理提供内容背景信息。未来计划将验证范围扩展至视频和音频格式,并整合到搜索等更多平台中。

    推荐理由:官方介绍了在 Gemini 应用中集成 SynthID 水印检测的具体交互方式,为内容真实性验证提供了新的入口。

  2. Hugging Face Blog65

    Hugging Face 发布 AnyLanguageModel:为 Apple 平台提供本地与远程 LLM 的统一 API

    Hugging Face 推出 Swift 包 AnyLanguageModel,作为 Apple Foundation Models 框架的即插即用替代方案,支持在单一 API 下无缝切换本地(MLX、Core ML、llama.cpp)和云端(OpenAI、Anthropic 等)大模型。

    推荐理由:该工具通过统一 API 简化了 Apple 平台本地与云端大模型的集成,降低了开发者尝试开源模型的技术门槛。

11月19日周三
  1. Google Research80

    Google Research 发布端到端实时语音到语音翻译模型

    Google Research 推出了一种创新的端到端语音到语音翻译(S2ST)模型,实现了仅2秒延迟的实时翻译,并能保留原始说话人的声音特征。该模型基于 AudioLM 框架和 SpectroStream 编解码技术,通过可扩展的时间同步数据获取管道进行训练,解决了传统级联系统延迟高、错误累积和缺乏个性化的问题。

    推荐理由:Google Research 发布了端到端实时语音到语音翻译模型,将延迟降至2秒并保留原声,已在 Google Meet 和 Pixel 10 中部署。

  2. Hugging Face Blog63

    ServiceNow AI 发布 Apriel-H1:通过蒸馏将 15B 推理模型转为 Mamba 混合架构

    ServiceNow AI 团队发布 Apriel-H1 系列模型,成功将 15B 全注意力推理模型蒸馏为 Mamba 混合架构,在保持推理质量的同时实现 2.1 倍吞吐量提升。

    推荐理由:揭示了蒸馏推理模型时选择高质量推理轨迹而非预训练数据的关键洞察,并提供了可复现的分阶段混合架构转换方法。

  3. Google DeepMind26

    Google DeepMind 在新加坡开设新研究实验室以推进亚太区 AI 发展

    Google DeepMind 宣布在新加坡开设新的研究实验室,旨在加速 Gemini 及前沿 AI 在亚太地区的实际应用。该团队将深化与政府、企业及学术机构的合作,重点推进语言文化包容性研究及模型能力升级。此前其亚太团队规模已翻倍,并正通过 AlphaFold、SEA-LION v4 等项目支持当地科研与公共服务创新。

  4. Google Research82

    Google 推出 Generative UI:在 Gemini 和搜索中实现动态交互式界面

    Google Research 正式介绍 Generative UI(生成式用户界面)能力,该功能利用 AI 模型根据提示词动态生成网页、游戏或工具等完整交互体验,而非仅渲染静态内容。

    推荐理由:官方展示了基于 Gemini 3 的生成式 UI 技术,通过动态创建交互式界面替代静态文本输出,并已在搜索和助手应用中开启实验。

11月17日周一
  1. Google DeepMind78

    Google DeepMind 发布 WeatherNext 2 气象预报模型

    Google DeepMind 与 Google Research 联合发布最新气象预报模型 WeatherNext 2。该模型生成预报的速度比前代快 8 倍,分辨率提升至小时级,并能从单一输入预测数百种可能的气象情景。

    推荐理由:原文给出了预测速度、分辨率提升及数据开放入口,读者可据此评估其对气象决策和现有工作流的实际改变。

11月14日周五
11月13日周四
  1. Google DeepMind65

    Google DeepMind 发布 SIMA 2:具备推理与自我学习能力的虚拟世界智能体

    Google DeepMind 推出新一代通用 AI 智能体 SIMA 2,通过集成 Gemini 模型实现从指令跟随到交互式游戏伙伴的跨越。SIMA 2 具备复杂推理、多模态理解及跨环境泛化能力,能在未训练过的游戏(如 ASKA)和 Genie 3 生成的全新世界中执行任务。该模型还引入了基于试错和反馈的自我改进循环,目前作为有限研究预览向部分学者和游戏开发者开放。

    推荐理由:官方展示了集成 Gemini 推理能力的 SIMA 2 在虚拟世界中的泛化与自我改进机制,为具身智能研究提供了新的技术路径参考。

  2. Google Research38

    Google Quantum AI 提出 DQI 算法加速优化问题求解

    Google Quantum AI 联合斯坦福等机构在 Nature 发表研究,提出 Decoded Quantum Interferometry (DQI) 量子算法。该算法将优化问题转化为解码问题,利用量子干涉寻找近似最优解。针对最优多项式交集(OPI)问题,DQI 仅需数百万次量子逻辑操作,而经典计算机需超过 $10^{23}$ 次运算。

11月12日周三
11月11日周二
11月8日周六
  1. Google Research58

    Google Research 发布嵌套学习范式及 Hope 架构以解决灾难性遗忘

    Google Research 在 NeurIPS 2025 发表“Nested Learning”论文,提出一种新的机器学习范式,旨在通过统一模型架构与优化算法来解决大语言模型的灾难性遗忘问题。该范式将模型视为一组相互关联的多层级优化问题,利用连续记忆系统(CMS)实现不同频率的权重更新。基于此原理设计的自修改架构 Hope 在语言建模和长上下文推理任务中表现出优于现有 SOTA 模型的性能。

11月7日周五
11月6日周四
  1. Google DeepMind40

    Google DeepMind 发布森林砍伐预测基准、物种分布图谱及 Perch 2.0 更新

    Google DeepMind 联合 World Resources Institute 推出基于 Vision Transformers 的森林砍伐风险预测基准,实现 30 米级高分辨率监测。同时发布利用 Graph Neural Net 和 AlphaEarth Foundations 生成的物种分布图谱,并更新动物声音分类模型 Perch 2.0,支持快速适配新物种识别以辅助生态保护。

11月5日周三
  1. Google Research68

    Google Research 发布太空可扩展 AI 基础设施系统设计预印本论文

    Google Research 发布名为 Project Suncatcher 的研究项目及相关预印本论文,提出构建由自由空间光链路连接的太阳能卫星星座以承载 Google TPUs 进行 AI 计算。

    推荐理由:Google Research 发布关于太空 AI 基础设施的预印本论文,详细论证了利用太阳能卫星星座承载 TPU 进行大规模计算的可行性与挑战。

10月31日周五
10月30日周四
  1. Google Research68

    Google Research 提出可证明隐私洞察系统以分析生成式 AI 使用

    Google Research 推出“可证明隐私洞察”(PPI)系统,利用大语言模型、差分隐私和可信执行环境分析非结构化生成式 AI 数据。该系统已在 Pixel Recorder 应用中部署,使用开源 Gemma 3 模型在 TEE 内对转录文本进行分类聚合,确保原始数据不离开安全边界且输出具备用户级差分隐私保证。相关代码及机密联邦分析栈已开源,允许外部验证服务器端处理仅执行隐私保护计算。

    推荐理由:原文详述了结合大语言模型、差分隐私与可信执行环境的可证明隐私洞察系统,为分析端侧生成式 AI 数据提供了兼顾透明度与用户级隐私保护的技术路径。

  2. Hugging Face Blog60

    MiniMax 解析 M2 智能体对齐:从基准测试到真实世界泛化

    MiniMax 团队发布博客阐述 MiniMax M2 在智能体后训练阶段的对齐经验,强调需同时兼顾开源基准表现与真实世界的鲁棒性。文章提出“交错思考”(Interleaved Thinking)机制以维持长程任务焦点并适应外部扰动,并指出真正的泛化源于对系统提示、环境及工具响应等全操作空间扰动的稳定性,而非仅靠增加工具数量。

    推荐理由:MiniMax 团队分享 M2 模型在智能体对齐中的核心洞察,指出泛化关键在于应对全轨迹扰动而非单纯工具扩展。

10月29日周三
  1. Hugging Face Blog73

    Hugging Face 分析全球算力格局变迁:中国芯片崛起与开源创新

    Hugging Face 发布深度分析指出,美国出口管制加速了中国国产 AI 芯片(如华为昇腾、寒武纪)的研发与应用,目前已有高性能开源模型开始基于这些国产芯片进行推理甚至训练。算力限制促使中国实验室在架构效率(如 DeepSeek 的 MLA、GRPO)和软件栈(CUDA 替代品)上取得突破,推动了低成本、高能效开源模型的爆发,进而改变了全球 AI 开发与部署的经济结构。

    推荐理由:文章梳理了出口管制如何倒逼中国芯片自研与算法创新,揭示了算力稀缺环境下开源模型对全球AI格局的重塑。

  2. Hugging Face Blog40

    NVIDIA Isaac for Healthcare v0.4 发布 SO-ARM 手术机器人仿真到部署工作流

    NVIDIA Isaac for Healthcare v0.4 推出基于 SO-ARM 的端到端手术辅助机器人开发工作流,覆盖数据采集、训练与硬件部署。该流程采用 Sim2Real 混合训练策略,93% 以上数据由仿真生成,通过微调 GR00T N1.5 模型实现实时推理。开发者可在单台 DGX Spark 上完成全流程,显著降低医疗机器人研发门槛。

10月28日周二
  1. Hugging Face Blog52

    IBM 发布 Granite 4.0 Nano 系列小参数模型

    IBM 发布 Granite 4.0 Nano 系列模型,包含 1B 和 350M 参数的混合架构及传统 Transformer 版本,专为边缘和端侧应用设计。该系列采用 Apache 2.0 许可证开源,支持 vLLM、llama.cpp 和 MLX 等运行时,并基于超过 15T tokens 的数据训练,旨在证明无需数百亿参数也能构建高效实用的模型。