Google DeepMind 宣布支持美国能源部 Genesis Mission 以加速科学发现
Google DeepMind 宣布支持白宫发起的 Genesis Mission,旨在通过 AI 技术变革科学研究方式并加速美国科学创新。该计划将动员美国能源部下属的 17 个国家实验室、工业界和学术界共同构建集成发现平台。
Google DeepMind 宣布支持白宫发起的 Genesis Mission,旨在通过 AI 技术变革科学研究方式并加速美国科学创新。该计划将动员美国能源部下属的 17 个国家实验室、工业界和学术界共同构建集成发现平台。
Google Research 本周发布一款基于线性回归的轻量级 AI 模型,用于预测特定时间后电动汽车充电口的可用概率。该模型通过整合“小时”特征与权重,在 CA 和德国数据上表现优于“保持当前状态”基线,有效缓解续航焦虑并提升导航效率。
Hugging Face 在 Open ASR Leaderboard 中新增多语言和长音频转录赛道,对比了来自 18 个组织的 60+ 模型。数据显示 Conformer 编码器结合 LLM 解码器(如 Canary-Qwen-2.5B)准确率最高,而 CTC/TDT 解码器速度提升 10–100 倍;长音频场景下闭源系统仍领先,开源最佳为 Whisper Large v3。
Hugging Face TRL 正式集成 RapidFire AI,通过自适应分块并发训练将微调实验吞吐量提升约 16–24 倍。用户可使用 RFSFTConfig 等零代码替换配置,在单 GPU 上并发比较多个 LLM 微调方案。该工具提供实时仪表盘与交互式控制操作,支持动态停止、克隆及修改运行中的任务以优化资源利用。
Google DeepMind 宣布在 Gemini 应用中引入 AI 图像验证功能,用户可通过上传图像询问是否由 Google AI 生成或编辑。该功能基于 SynthID 数字水印技术,结合模型推理提供内容背景信息。未来计划将验证范围扩展至视频和音频格式,并整合到搜索等更多平台中。
推荐理由:官方介绍了在 Gemini 应用中集成 SynthID 水印检测的具体交互方式,为内容真实性验证提供了新的入口。
Google DeepMind 正式推出 Nano Banana Pro(即 Gemini 3 Pro Image),这是一款基于 Gemini 3 Pro 构建的高保真图像生成与编辑模型。
推荐理由:官方详细说明了新模型在文本渲染、物理控制及搜索接地方面的能力升级,并给出了开发者接入路径。
Google DeepMind 推出基于 Gemini 3 Pro 的新一代图像生成与编辑模型 Nano Banana Pro (Gemini 3 Pro Image)。
推荐理由:原文详细列出了新模型在文本渲染、多图融合及推理能力上的具体升级,并明确了各产品线与订阅层级的开放入口。
Hugging Face 推出 Swift 包 AnyLanguageModel,作为 Apple Foundation Models 框架的即插即用替代方案,支持在单一 API 下无缝切换本地(MLX、Core ML、llama.cpp)和云端(OpenAI、Anthropic 等)大模型。
推荐理由:该工具通过统一 API 简化了 Apple 平台本地与云端大模型的集成,降低了开发者尝试开源模型的技术门槛。
Mistral AI 宣布扩大在德国的业务布局,通过与 SAP 和 Helsing 的长期战略合作推动欧洲 AI 自主权。公司与 SAP 建立多年伙伴关系,将模型集成至 SAP AI Foundation 以构建完全主权 AI 栈;同时与 Helsing 加速开发用于国防安全应用的视觉-语言-动作模型。
Google Research 推出了一种创新的端到端语音到语音翻译(S2ST)模型,实现了仅2秒延迟的实时翻译,并能保留原始说话人的声音特征。该模型基于 AudioLM 框架和 SpectroStream 编解码技术,通过可扩展的时间同步数据获取管道进行训练,解决了传统级联系统延迟高、错误累积和缺乏个性化的问题。
推荐理由:Google Research 发布了端到端实时语音到语音翻译模型,将延迟降至2秒并保留原声,已在 Google Meet 和 Pixel 10 中部署。
ServiceNow AI 团队发布 Apriel-H1 系列模型,成功将 15B 全注意力推理模型蒸馏为 Mamba 混合架构,在保持推理质量的同时实现 2.1 倍吞吐量提升。
推荐理由:揭示了蒸馏推理模型时选择高质量推理轨迹而非预训练数据的关键洞察,并提供了可复现的分阶段混合架构转换方法。
Google DeepMind 正式发布 Gemini 3 Pro,该模型在 Terminal-Bench 2.0 上得分 54.2%,并在 WebDev Arena 中以 1487 Elo 登顶。
推荐理由:原文给出了 Gemini 3 Pro 在智能体编程和多模态推理上的基准表现,以及配套的 Antigravity 平台和 API 定价细节。
Google DeepMind 宣布在新加坡开设新的研究实验室,旨在加速 Gemini 及前沿 AI 在亚太地区的实际应用。该团队将深化与政府、企业及学术机构的合作,重点推进语言文化包容性研究及模型能力升级。此前其亚太团队规模已翻倍,并正通过 AlphaFold、SEA-LION v4 等项目支持当地科研与公共服务创新。
Google DeepMind 正式发布 Gemini 3 系列模型,其中 Gemini 3 Pro 已在 Google 搜索、Gemini App 及开发者平台上线。
推荐理由:原文披露了 Gemini 3 Pro 在多项基准测试中的具体分数及 Deep Think 模式的性能提升,并介绍了配套的 Antigravity 开发平台,为评估其实际能力边界提供了量化依据。
Google DeepMind 推出名为 Google Antigravity 的新智能体开发平台,旨在将 IDE 演变为支持浏览器控制和异步交互的 agent-first 环境。
推荐理由:原文详细阐述了从同步 IDE 向异步 Agent-first 平台演进的产品形态,为开发者提供了评估下一代智能体编程工具的具体维度。
Google Research 正式介绍 Generative UI(生成式用户界面)能力,该功能利用 AI 模型根据提示词动态生成网页、游戏或工具等完整交互体验,而非仅渲染静态内容。
推荐理由:官方展示了基于 Gemini 3 的生成式 UI 技术,通过动态创建交互式界面替代静态文本输出,并已在搜索和助手应用中开启实验。
Google DeepMind 与 Google Research 联合发布最新气象预报模型 WeatherNext 2。该模型生成预报的速度比前代快 8 倍,分辨率提升至小时级,并能从单一输入预测数百种可能的气象情景。
推荐理由:原文给出了预测速度、分辨率提升及数据开放入口,读者可据此评估其对气象决策和现有工作流的实际改变。
Hugging Face 发布指南,演示如何利用 kernels 库构建、测试并分享兼容 AMD GPU 的 ROCm 内核。文中以 RadeonFlow GEMM 为例,展示该 FP8 矩阵乘法内核在 MI300X 上的高性能实现及 PyTorch 集成流程。
AMD、Hugging Face 和 Data Monsters 联合举办 AMD Open Robotics Hackathon,将于2025年12月5-7日在东京及12月12-14日在巴黎举行。参赛者需组建最多4人的团队,利用 LeRobot、AMD Ryzen AI 笔记本及 Instinct MI300X GPU 完成两项任务。每城市前7名队伍获奖,冠军奖金为 $10,000。
Google Research 联合 Google DeepMind、WRI 和 IIASA 发布 Natural Forests of the World 2020 数据集及论文,提供全球首个区分天然林与其他树木覆盖的10米分辨率地图,验证准确率达92.2%。
Google DeepMind 推出新一代通用 AI 智能体 SIMA 2,通过集成 Gemini 模型实现从指令跟随到交互式游戏伙伴的跨越。SIMA 2 具备复杂推理、多模态理解及跨环境泛化能力,能在未训练过的游戏(如 ASKA)和 Genie 3 生成的全新世界中执行任务。该模型还引入了基于试错和反馈的自我改进循环,目前作为有限研究预览向部分学者和游戏开发者开放。
推荐理由:官方展示了集成 Gemini 推理能力的 SIMA 2 在虚拟世界中的泛化与自我改进机制,为具身智能研究提供了新的技术路径参考。
Google Quantum AI 联合斯坦福等机构在 Nature 发表研究,提出 Decoded Quantum Interferometry (DQI) 量子算法。该算法将优化问题转化为解码问题,利用量子干涉寻找近似最优解。针对最优多项式交集(OPI)问题,DQI 仅需数百万次量子逻辑操作,而经典计算机需超过 $10^{23}$ 次运算。
Hugging Face 宣布与 Google Cloud 建立新的深度合作伙伴关系,旨在帮助企业利用开源模型构建自己的 AI。双方将共同开发基于 Hugging Face Xet 和 Google Cloud 存储网络技术的 CDN Gateway,以显著缩短模型和数据集的下载时间。
Google Research 发布 JAX-Privacy 1.0,基于 JAX 构建模块化差分隐私训练与审计工具包。该版本集成最新研究进展,支持 DP-SGD、DP-FTRL 及矩阵分解等算法,利用 JAX 原生并行特性实现大规模模型的高效私有训练。
Google DeepMind 在 Nature 发表研究,提出基于 SigLIP-SO400M 的三步对齐法,利用 THINGS 数据集生成 AligNet 以重构模型视觉表征。该方法使 AI 内部映射按人类认知层级有序组织,显著提升了系统的鲁棒性、泛化能力及可靠性。
Google DeepMind 与 C2k 合作在北爱尔兰开展为期六个月的 Gemini 试点,参与教师平均每周节省 10 小时用于行政工作。该计划收集了超过 600 个使用案例,涵盖利用 NotebookLM 生成播客及创建个性化课程等场景。C2k 计划将 Gemini 培训推广至更多北爱尔兰教师。
Google Research 在 NeurIPS 2025 发表“Nested Learning”论文,提出一种新的机器学习范式,旨在通过统一模型架构与优化算法来解决大语言模型的灾难性遗忘问题。该范式将模型视为一组相互关联的多层级优化问题,利用连续记忆系统(CMS)实现不同频率的权重更新。基于此原理设计的自修改架构 Hope 在语言建模和长上下文推理任务中表现出优于现有 SOTA 模型的性能。
Google Research 发布 DS-STAR,通过文件分析、LLM 验证及迭代规划解决复杂数据科学任务。该智能体在 DABStep 基准测试中将准确率从 41.0% 提升至 45.2%,并在 KramaBench 和 DA-Code 上超越 AutoGen 等现有方法。
Google DeepMind 联合 World Resources Institute 推出基于 Vision Transformers 的森林砍伐风险预测基准,实现 30 米级高分辨率监测。同时发布利用 Graph Neural Net 和 AlphaEarth Foundations 生成的物种分布图谱,并更新动物声音分类模型 Perch 2.0,支持快速适配新物种识别以辅助生态保护。
Google Research 推出 ForestCast,利用基于 vision transformers 的深度学习模型和纯卫星数据预测森林砍伐风险。该方法无需易过时的地理空间输入,准确率匹配或超越现有方案,并发布了首个公开基准数据集以支持社区复现与改进。
Google Research 发布名为 Project Suncatcher 的研究项目及相关预印本论文,提出构建由自由空间光链路连接的太阳能卫星星座以承载 Google TPUs 进行 AI 计算。
推荐理由:Google Research 发布关于太空 AI 基础设施的预印本论文,详细论证了利用太阳能卫星星座承载 TPU 进行大规模计算的可行性与挑战。
Google Research 在 Research@ 活动中发布了多项最新研究突破,包括 Google Earth AI、DeepSomatic 和 Quantum Echoes。
推荐理由:原文汇总了地球AI、基因组学和量子计算领域的最新突破,展示了从基础模型到实际应用的完整闭环。
Google Research 推出“可证明隐私洞察”(PPI)系统,利用大语言模型、差分隐私和可信执行环境分析非结构化生成式 AI 数据。该系统已在 Pixel Recorder 应用中部署,使用开源 Gemma 3 模型在 TEE 内对转录文本进行分类聚合,确保原始数据不离开安全边界且输出具备用户级差分隐私保证。相关代码及机密联邦分析栈已开源,允许外部验证服务器端处理仅执行隐私保护计算。
推荐理由:原文详述了结合大语言模型、差分隐私与可信执行环境的可证明隐私洞察系统,为分析端侧生成式 AI 数据提供了兼顾透明度与用户级隐私保护的技术路径。
MiniMax 团队发布博客阐述 MiniMax M2 在智能体后训练阶段的对齐经验,强调需同时兼顾开源基准表现与真实世界的鲁棒性。文章提出“交错思考”(Interleaved Thinking)机制以维持长程任务焦点并适应外部扰动,并指出真正的泛化源于对系统提示、环境及工具响应等全操作空间扰动的稳定性,而非仅靠增加工具数量。
推荐理由:MiniMax 团队分享 M2 模型在智能体对齐中的核心洞察,指出泛化关键在于应对全轨迹扰动而非单纯工具扩展。
Google Research 在 UIST’25 会议上介绍了 StreetReaderAI,这是一个利用上下文感知实时 AI 和 Gemini 模型使 Google Street View 对盲人及低视力人群可访问的概念验证原型。
Hugging Face 发布深度分析指出,美国出口管制加速了中国国产 AI 芯片(如华为昇腾、寒武纪)的研发与应用,目前已有高性能开源模型开始基于这些国产芯片进行推理甚至训练。算力限制促使中国实验室在架构效率(如 DeepSeek 的 MLA、GRPO)和软件栈(CUDA 替代品)上取得突破,推动了低成本、高能效开源模型的爆发,进而改变了全球 AI 开发与部署的经济结构。
推荐理由:文章梳理了出口管制如何倒逼中国芯片自研与算法创新,揭示了算力稀缺环境下开源模型对全球AI格局的重塑。
NVIDIA Isaac for Healthcare v0.4 推出基于 SO-ARM 的端到端手术辅助机器人开发工作流,覆盖数据采集、训练与硬件部署。该流程采用 Sim2Real 混合训练策略,93% 以上数据由仿真生成,通过微调 GR00T N1.5 模型实现实时推理。开发者可在单台 DGX Spark 上完成全流程,显著降低医疗机器人研发门槛。
NVIDIA Isaac for Healthcare v0.4 推出基于 SO-ARM 的端到端手术辅助机器人工作流,支持从数据采集、模型训练到硬件部署的全流程。
IBM 发布 Granite 4.0 Nano 系列模型,包含 1B 和 350M 参数的混合架构及传统 Transformer 版本,专为边缘和端侧应用设计。该系列采用 Apache 2.0 许可证开源,支持 vLLM、llama.cpp 和 MLX 等运行时,并基于超过 15T tokens 的数据训练,旨在证明无需数百亿参数也能构建高效实用的模型。
Hugging Face 推出“voice consent gate”概念,要求用户朗读包含模型名的特定句子以显式授权语音克隆。该方案结合 ASR 与 TTS 技术,确保仅在识别到实时麦克风输入的同意语句后才启动合成,旨在平衡深度伪造风险与辅助沟通等正向应用。