Google 2025年研究突破回顾:Gemini 3、Gemma及AI代理进展
Google发布Gemini 3 Pro与Flash,前者在MathArena Apex达23.4% SOTA并登顶LMArena,后者以更低成本实现Pro级推理。开源模型Gemma 3增强多模态能力,Google Antigravity推动AI辅助软件开发。
Google发布Gemini 3 Pro与Flash,前者在MathArena Apex达23.4% SOTA并登顶LMArena,后者以更低成本实现Pro级推理。开源模型Gemma 3增强多模态能力,Google Antigravity推动AI辅助软件开发。
Google Research 发布 2025 年成果,Gemini 3 在 SimpleQA Verified 和 FACTS 基准上实现 SOTA 事实性表现。开源模型 Gemma 支持超 140 种语言,成为最佳多语言开放模型;量子领域宣布“可验证量子优势”并推出 verifiable quantum echo 算法。
Google DeepMind 发布 Gemini 3 Flash,旨在以更低成本和更高速度提供接近 Pro 级别的前沿智能。该模型在 GPQA Diamond 得分 90.4%,SWE-bench Verified 得分 78%,比 Gemini 2.5 Pro 快 3 倍且平均少用 30% token。
推荐理由:原文给出了 Gemini 3 Flash 在多项基准测试中的具体分数、定价及与上一代模型的性能对比,读者可据此评估其在速度与成本平衡上的实际竞争力。
Google DeepMind 发布 Gemma Scope 2,这是目前规模最大的开源可解释性工具套件,支持从 270M 到 27B 参数的所有 Gemma 3 模型。该工具结合稀疏自编码器(SAEs)和转码器,旨在帮助研究人员追踪模型内部决策过程以调试越狱、幻觉等安全问题。
Google Research 推出名为 Paper Assistant Tool (PAT) 的实验性工具,利用 Gemini 2.5 Deep Think 为 STOC 2026 的理论计算机科学论文提供提交前的自动反馈。
推荐理由:原文披露了基于 Gemini 2.5 Deep Think 的 Paper Assistant Tool 在 STOC 2026 的实验数据,展示了 AI 辅助理论计算机科学论文预审核的实际效果与用户反馈。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio 模型,旨在优化实时语音代理的自然对话与复杂任务处理能力。
推荐理由:官方更新了 Gemini 2.5 Flash Native Audio 模型,显著提升了实时语音代理在复杂工作流处理、指令遵循及多轮对话中的表现。
Google 联合 SisonkeBiotik 等社区举办非洲健康数据科学 Ideathon,鼓励利用 MedGemma、TxGemma 和 MedSigLIP 解决本地医疗挑战。冠军 Dawa Health 基于 MedSigLIP 与 Gemini RAG 构建宫颈癌筛查工具,计划明年扩展至 50,000 名患者。
Google DeepMind 宣布与英国 AI 安全研究所(AISI)签署新谅解备忘录,将合作从模型测试扩展至基础安全研究。双方将共享专有模型数据,重点开展思维链监控、社会情感影响评估及经济系统模拟等前沿课题。此举旨在通过联合报告与技术协作,提升 Gemini 3 等先进模型的安全性并推动行业进步。
Google Research 在 COLM 2025 发布 Urania 框架,利用差分隐私(DP)聚类与关键词提取从 LLM 对话中生成安全洞察。该方案通过数学化隐私预算 ε 确保单条对话不影响结果,相比 CLIO 等启发式方法提供更强的形式化隐私保证。
Google DeepMind 宣布深化与英国政府的合作,重点加速 AI 在科学发现、教育现代化及国家安全领域的落地。双方将提供 AlphaEvolve、AlphaGenome 等前沿模型优先访问权,并于 2026 年在英国建立首个全自动材料科学实验室。
Google DeepMind 与 Kaggle 合作发布 FACTS Benchmark Suite,包含参数化、搜索、多模态及 Grounding v2 四个基准,共提供 3,513 个公开示例。
Google Research 推出 Titans 架构及 MIRAS 理论框架,结合 RNN 速度与 Transformer 精度实现测试时记忆。Titans 利用“惊讶度”指标动态更新参数,通过动量机制和自适应权重衰减管理长序列信息。MIRAS 将序列建模统一为关联内存模块,突破均方误差范式限制,支持实时适应无需离线重训练。
密歇根州立大学团队利用 AlphaFold 预测光合作用关键酶 GLYK 的三维结构,发现高温下其柔性环易失稳。研究人员借鉴嗜热藻类特征构建混合酶,成功使该酶在 65 °C 高温下保持稳定,为培育耐热作物提供新路径。
Google Research 在 NeurIPS 2025 上推出 Massive Sound Embedding Benchmark (MSEB),旨在标准化评估多模态模型的八项核心听觉能力。该基准包含新开源的 SVQ 数据集,涵盖 177,352 条跨 26 个地区、17 种语言的语音查询。实验显示当前声音表示远非通用,在所有任务中存在显著性能提升空间。
Google DeepMind AlphaFold 团队发文纪念 AlphaFold 2 发布五周年,回顾其如何解决蛋白质结构预测这一生物学重大挑战并获得诺贝尔奖。
科学家利用 AlphaFold 结合冷冻电镜技术,成功绘制出构成“坏胆固醇”(LDL)骨架的关键蛋白 apoB100 的原子分辨率结构。这一发现揭示了 LDL 颗粒外部的笼状外壳形态,有助于深入理解动脉粥样硬化性心血管疾病(ASCVD)的致病机制,并为预防和治疗该全球头号死因提供新的研发方向。
Google DeepMind 宣布支持白宫发起的 Genesis Mission,旨在通过 AI 技术变革科学研究方式并加速美国科学创新。该计划将动员美国能源部下属的 17 个国家实验室、工业界和学术界共同构建集成发现平台。
Google Research 本周发布一款基于线性回归的轻量级 AI 模型,用于预测特定时间后电动汽车充电口的可用概率。该模型通过整合“小时”特征与权重,在 CA 和德国数据上表现优于“保持当前状态”基线,有效缓解续航焦虑并提升导航效率。
Google DeepMind 宣布在 Gemini 应用中引入 AI 图像验证功能,用户可通过上传图像询问是否由 Google AI 生成或编辑。该功能基于 SynthID 数字水印技术,结合模型推理提供内容背景信息。未来计划将验证范围扩展至视频和音频格式,并整合到搜索等更多平台中。
推荐理由:官方介绍了在 Gemini 应用中集成 SynthID 水印检测的具体交互方式,为内容真实性验证提供了新的入口。
Google DeepMind 正式推出 Nano Banana Pro(即 Gemini 3 Pro Image),这是一款基于 Gemini 3 Pro 构建的高保真图像生成与编辑模型。
推荐理由:官方详细说明了新模型在文本渲染、物理控制及搜索接地方面的能力升级,并给出了开发者接入路径。
Google DeepMind 推出基于 Gemini 3 Pro 的新一代图像生成与编辑模型 Nano Banana Pro (Gemini 3 Pro Image)。
推荐理由:原文详细列出了新模型在文本渲染、多图融合及推理能力上的具体升级,并明确了各产品线与订阅层级的开放入口。
Google Research 推出了一种创新的端到端语音到语音翻译(S2ST)模型,实现了仅2秒延迟的实时翻译,并能保留原始说话人的声音特征。该模型基于 AudioLM 框架和 SpectroStream 编解码技术,通过可扩展的时间同步数据获取管道进行训练,解决了传统级联系统延迟高、错误累积和缺乏个性化的问题。
推荐理由:Google Research 发布了端到端实时语音到语音翻译模型,将延迟降至2秒并保留原声,已在 Google Meet 和 Pixel 10 中部署。
Google DeepMind 正式发布 Gemini 3 Pro,该模型在 Terminal-Bench 2.0 上得分 54.2%,并在 WebDev Arena 中以 1487 Elo 登顶。
推荐理由:原文给出了 Gemini 3 Pro 在智能体编程和多模态推理上的基准表现,以及配套的 Antigravity 平台和 API 定价细节。
Google DeepMind 宣布在新加坡开设新的研究实验室,旨在加速 Gemini 及前沿 AI 在亚太地区的实际应用。该团队将深化与政府、企业及学术机构的合作,重点推进语言文化包容性研究及模型能力升级。此前其亚太团队规模已翻倍,并正通过 AlphaFold、SEA-LION v4 等项目支持当地科研与公共服务创新。
Google DeepMind 正式发布 Gemini 3 系列模型,其中 Gemini 3 Pro 已在 Google 搜索、Gemini App 及开发者平台上线。
推荐理由:原文披露了 Gemini 3 Pro 在多项基准测试中的具体分数及 Deep Think 模式的性能提升,并介绍了配套的 Antigravity 开发平台,为评估其实际能力边界提供了量化依据。
Google DeepMind 推出名为 Google Antigravity 的新智能体开发平台,旨在将 IDE 演变为支持浏览器控制和异步交互的 agent-first 环境。
推荐理由:原文详细阐述了从同步 IDE 向异步 Agent-first 平台演进的产品形态,为开发者提供了评估下一代智能体编程工具的具体维度。
Google Research 正式介绍 Generative UI(生成式用户界面)能力,该功能利用 AI 模型根据提示词动态生成网页、游戏或工具等完整交互体验,而非仅渲染静态内容。
推荐理由:官方展示了基于 Gemini 3 的生成式 UI 技术,通过动态创建交互式界面替代静态文本输出,并已在搜索和助手应用中开启实验。
Google DeepMind 与 Google Research 联合发布最新气象预报模型 WeatherNext 2。该模型生成预报的速度比前代快 8 倍,分辨率提升至小时级,并能从单一输入预测数百种可能的气象情景。
推荐理由:原文给出了预测速度、分辨率提升及数据开放入口,读者可据此评估其对气象决策和现有工作流的实际改变。
Google Research 联合 Google DeepMind、WRI 和 IIASA 发布 Natural Forests of the World 2020 数据集及论文,提供全球首个区分天然林与其他树木覆盖的10米分辨率地图,验证准确率达92.2%。
Google DeepMind 推出新一代通用 AI 智能体 SIMA 2,通过集成 Gemini 模型实现从指令跟随到交互式游戏伙伴的跨越。SIMA 2 具备复杂推理、多模态理解及跨环境泛化能力,能在未训练过的游戏(如 ASKA)和 Genie 3 生成的全新世界中执行任务。该模型还引入了基于试错和反馈的自我改进循环,目前作为有限研究预览向部分学者和游戏开发者开放。
推荐理由:官方展示了集成 Gemini 推理能力的 SIMA 2 在虚拟世界中的泛化与自我改进机制,为具身智能研究提供了新的技术路径参考。
Google Quantum AI 联合斯坦福等机构在 Nature 发表研究,提出 Decoded Quantum Interferometry (DQI) 量子算法。该算法将优化问题转化为解码问题,利用量子干涉寻找近似最优解。针对最优多项式交集(OPI)问题,DQI 仅需数百万次量子逻辑操作,而经典计算机需超过 $10^{23}$ 次运算。
Hugging Face 宣布与 Google Cloud 建立新的深度合作伙伴关系,旨在帮助企业利用开源模型构建自己的 AI。双方将共同开发基于 Hugging Face Xet 和 Google Cloud 存储网络技术的 CDN Gateway,以显著缩短模型和数据集的下载时间。
Google Research 发布 JAX-Privacy 1.0,基于 JAX 构建模块化差分隐私训练与审计工具包。该版本集成最新研究进展,支持 DP-SGD、DP-FTRL 及矩阵分解等算法,利用 JAX 原生并行特性实现大规模模型的高效私有训练。
Google DeepMind 在 Nature 发表研究,提出基于 SigLIP-SO400M 的三步对齐法,利用 THINGS 数据集生成 AligNet 以重构模型视觉表征。该方法使 AI 内部映射按人类认知层级有序组织,显著提升了系统的鲁棒性、泛化能力及可靠性。
Google DeepMind 与 C2k 合作在北爱尔兰开展为期六个月的 Gemini 试点,参与教师平均每周节省 10 小时用于行政工作。该计划收集了超过 600 个使用案例,涵盖利用 NotebookLM 生成播客及创建个性化课程等场景。C2k 计划将 Gemini 培训推广至更多北爱尔兰教师。
Google Research 在 NeurIPS 2025 发表“Nested Learning”论文,提出一种新的机器学习范式,旨在通过统一模型架构与优化算法来解决大语言模型的灾难性遗忘问题。该范式将模型视为一组相互关联的多层级优化问题,利用连续记忆系统(CMS)实现不同频率的权重更新。基于此原理设计的自修改架构 Hope 在语言建模和长上下文推理任务中表现出优于现有 SOTA 模型的性能。
Google Research 发布 DS-STAR,通过文件分析、LLM 验证及迭代规划解决复杂数据科学任务。该智能体在 DABStep 基准测试中将准确率从 41.0% 提升至 45.2%,并在 KramaBench 和 DA-Code 上超越 AutoGen 等现有方法。
Google DeepMind 联合 World Resources Institute 推出基于 Vision Transformers 的森林砍伐风险预测基准,实现 30 米级高分辨率监测。同时发布利用 Graph Neural Net 和 AlphaEarth Foundations 生成的物种分布图谱,并更新动物声音分类模型 Perch 2.0,支持快速适配新物种识别以辅助生态保护。
Google Research 推出 ForestCast,利用基于 vision transformers 的深度学习模型和纯卫星数据预测森林砍伐风险。该方法无需易过时的地理空间输入,准确率匹配或超越现有方案,并发布了首个公开基准数据集以支持社区复现与改进。
Google Research 发布名为 Project Suncatcher 的研究项目及相关预印本论文,提出构建由自由空间光链路连接的太阳能卫星星座以承载 Google TPUs 进行 AI 计算。
推荐理由:Google Research 发布关于太空 AI 基础设施的预印本论文,详细论证了利用太阳能卫星星座承载 TPU 进行大规模计算的可行性与挑战。