Google DeepMind 发布 Gemini 4 Argon 模型
Google DeepMind 发布新前沿模型 Gemini 4 Argon,旨在提升复杂工作流中的深度推理能力,并已通过 Fairwind Program 向受信任的网络安全防御者推出。
推荐理由:原文披露了 Gemini 4 Argon 在长上下文输出、软件工程基准及网络安全防御上的具体性能数据与分阶段开放策略,为评估前沿模型能力边界提供了直接依据。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,旨在提升复杂工作流中的深度推理能力,并已通过 Fairwind Program 向受信任的网络安全防御者推出。
推荐理由:原文披露了 Gemini 4 Argon 在长上下文输出、软件工程基准及网络安全防御上的具体性能数据与分阶段开放策略,为评估前沿模型能力边界提供了直接依据。
Google DeepMind 发布 SynthID Bio,这是一套专为合成生物学设计的水印方法,能在不损害生物功能的前提下将不可察觉的数字签名直接嵌入到合成的物理蛋白质中。
推荐理由:原文展示了在保持蛋白质生物功能前提下嵌入数字水印的技术路径,为合成生物学提供了可验证的溯源手段。
Google Research 推出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题以统一引导与微调。该框架通过轻量级“转向阻尼器”网络动态调整生成轨迹,在保持基础模型画质稳定的同时精准对齐用户意图。实验显示其完全解锁版本对基线模型取得 90% 胜率,有效解决黑盒模型难以精细控制的痛点。
Google Research 推出名为“AI video co-director”的统一多智能体框架,旨在解决现有扩散模型在生成长篇叙事视频时面临的语义漂移和级联失败挑战。
推荐理由:Google Research 提出基于 Gemini 和 Veo 的多智能体框架,通过全局优化和世界状态跟踪解决长视频生成的语义漂移问题。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频生成与原生对话模型结合,为企业用户提供具备实时视觉呈现的交互式 AI 体验。
推荐理由:原文详述了实时视觉化身在对话中的同步机制与异步工具调用能力,为评估企业级多模态交互体验提供了具体技术细节。
NVIDIA与Google DeepMind等机构合作,在AlphaFold Database中开放了超过2,800种病毒的预测3D蛋白复合物结构。该数据集利用AlphaFold2模型结合NVIDIA BioNeMo Inference Runtime生成,旨在帮助科学家提前储备应对未来大流行的知识。
Google DeepMind 宣布在 Private AI Compute 平台引入新的服务器端持久记忆功能,旨在解决云端 AI 助手长期连续性与严格隐私标准之间的矛盾。
推荐理由:原文详述了通过硬件隔离和端到端加密实现云端持久记忆的技术架构,为理解隐私保护与跨设备连续性如何兼得提供了具体方案。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款新文本转语音模型,旨在将语音生成从静态预设转变为动态创意工具。
推荐理由:原文展示了从静态预设到动态创意工作室的转变,提供了角色定制、逐行导演及多语言支持的具体能力与基准表现。
Google Research 推出 MilleMiglia,这是一个用 C++ 编写的中间里程物流实例生成器,旨在解决该领域缺乏高质量公开数据的问题。它通过模拟真实的网络拓扑和需求分布,生成保护隐私的基准测试数据,以支持后续优化研究。源代码和文档已在 GitHub 开源。
Google Research 推出新研究实验,允许教师利用生成式用户界面(GenUI)创建定制化的交互式学习模拟器。该方案通过游戏化设计和教学护栏确保内容质量,目前已在 STEM 学科发布包含 30 多个由 AI 生成并经教师审核的示例库。
Emerald AI、Google 和 NVIDIA 宣布成立 AI 能源管理联盟(AEMA),旨在推动能根据电网状况动态管理用电的灵活 AI 数据中心。该联盟采用技术中立且基于性能的规则,通过标准化响应速度等指标,加速美国 AI 基础设施互联并提升电网可靠性。
Google Research 推出 Retrieve-for-Train 框架,通过离线强化学习将查询分解行为编译为监督信号,以解决 LLM 在复杂搜索中的推理瓶颈。该方案利用 RL 训练 Gemma3-4B 和 Qwen3-4B 生成对齐属性的子查询,并蒸馏至一个 53.9M 参数的扩散检索器中。此架构实现了单次非自回归推理,消除了测试时思维链开销,显著提升了集合级搜索结果的多样性与响应速度。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款最新实时对话模型,旨在提升语音智能体的近实时推理能力。
推荐理由:原文详细列出了两款新语音模型在多项基准测试中的具体得分及并行推理能力,为开发者评估实时语音智能体的性能与成本提供了直接依据。
Google Research 提出 ToolGrad,利用“答案优先”策略和文本梯度迭代构建复杂工具链数据。该方法在 Berkeley Function Calling Leaderboard 上表现优异,微调后的 ToolGrad-12B 得分 83.1,超越 Gemini 2.5 Pro、Claude 4.5 Opus 及 GPT-5 等专有模型。
Google DeepMind 推出 AlphaGenome Atlas,这是一个包含人类基因组中90亿个单核苷酸变异分子效应预测的平台。该数据集规模达1 PB,并引入了结合 AlphaGenome 和 AlphaMissense 的 AVI 评分以辅助变异排序。目前该平台已通过网站门户、API 以及 Google Antigravity 技能向学术研究免费开放。
推荐理由:原文提供了覆盖全基因组90亿变异的预测地图及免费访问入口,读者可据此评估其在罕见病解析与群体遗传学研究中的实际可用性。
Google Research 评估了利用 UK Biobank 欧洲数据向 Biobank Japan 进行多基因风险评分(PRS)的迁移效果。研究发现,当目标样本量超过 15k 时,混合外部数据反而限制精度提升;高遗传相关性性状可受益于更大规模欧洲数据,而血脂等特异性状则不然。
Google Research 与 HHMI Janelia 等机构合作,在《Cell》发表迄今最大的雄性果蝇大脑及中枢神经系统完整连接组图谱。该图谱包含超过 16.6 万个神经元和 1.25 亿个突触连接,通过 Neuroglancer 工具提供可视化与下载。这一成果利用 AI 技术加速了从电子显微镜图像到 3D 神经重建的过程,为研究动物感知、刺激反应及神经修复提供了基础资源。
Google DeepMind 与 Google Research 联合发布 WeatherNext 3,这是其最新且最准确的全球天气 AI 模型。该模型直接利用实时静止卫星数据进行训练,每小时生成一次高分辨率预报,地表变量分辨率达 5 公里,较前代提升约五倍。
推荐理由:该模型通过直接学习实时卫星数据实现了小时级高分辨率预报,并集成至 Google 核心产品生态。
Google DeepMind 推出 Fairwind 计划,向政府、关键基础设施运营商及可信合作伙伴提供受限访问权限,以利用其先进的网络防御能力。该计划整合了 Gemini 3.8 Flash Cyber 模型与 CodeMender 框架,帮助防御者在安全的云环境中自主发现、验证并修复漏洞,将原本需数周的手动修补过程缩短至几分钟。
推荐理由:原文给出了面向政府与企业的受限访问计划,读者可以据此判断其如何利用专用模型实现漏洞的自主发现与修复。
Google DeepMind 推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两款新模型,前者主打智能体工作流与编码,后者专攻网络安全防御。
推荐理由:原文给出了两款新模型在长周期编码和网络安全领域的具体基准表现及定价,读者可据此评估其在自动化工作流中的实际效能与成本优势。
Google Research 推出基于 Swin-S Transformer 的 MAPL-EMIT 框架,利用 EMIT 卫星数据自动检测全球甲烷羽流。该模型在专家标注数据上实现 84% 的高召回率,能同时完成增强量化、羽流分割和源定位。相关模型、合成数据及推理库已开源至 Kaggle 和 GitHub。
Google DeepMind 宣布在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中推出智能体视频理解功能。该功能通过让模型主动决定观看内容、速度和模态来替代固定帧率的静态处理,使 token 消耗最多降低 88%,成本最多减少 66%,准确率提升最高达 7%。
推荐理由:官方给出了视频理解从静态处理转向智能体动态检索的技术路径,并提供了具体的成本与精度优化数据。
Google Research 推出 TimesFM-3,这是一款拥有 3.3 亿参数的最新时间序列基础模型,原生支持多变量预测。该模型通过交替注意力机制和非自回归解码,能在单次前向传播中联合预测多个相关时间序列并处理外部协变量。
Google Research 推出实验性研究能力“行星预测引擎”(PPE),该系统能自主执行从数据发现到模型训练的完整地理空间建模工作流。PPE 通过智能数据选择、多模态数据集整理和自动模型构建三个阶段,将复杂预测模型的构建时间从数周缩短至几分钟。
Google DeepMind 推出 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 中提供工作室级视频生成能力。
推荐理由:原文详述了场景延长、首尾帧插值及4K升频等具体能力参数,为开发者评估生成式视频工作流的可控性与迭代效率提供了直接依据。
Google DeepMind 宣布推出全球首个针对专有前沿 AI 模型的双盲评估试点,旨在通过加密“盒子”限制外部评估数据的使用,防止模型在测试前优化性能以解决基准污染问题。该项目与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,使用 Gemini Flash Lite 模型对机密基准进行测试。
推荐理由:原文介绍了利用加密环境防止基准污染的双盲评估机制,为理解前沿模型评测的可信度提供了新的技术路径。
Google Research 推出 GlucoFM,一种采用双流设计分离血糖趋势与短期偏差的自监督基础模型。在四项队列的七项临床预测任务中,其 PR-AUC 平均比最佳 GluFormer 变体高 5.8 个百分点,并在餐后血糖反应预测中实现最低 MAE。该模型基于 109,066 小时无标签 CGM 数据预训练,展现出强大的跨数据集迁移及少样本适应能力。
Google DeepMind 发布最新语音转文字模型 Gemini 3.5 Transcribe,旨在实现精准且智能的实时转录。该模型在 Artificial Analysis 测试中达到流式 4.0% 和非流式 2.6% 的平均词错率,支持超过 85 种语言自动检测与转录,并具备处理自我纠正、去除填充词及自定义词汇的能力。
推荐理由:原文给出了新模型的流式与非流式词错率数据及多语言支持范围,开发者可据此评估其在实时语音交互场景中的落地可行性。
Google Research 在 CHI 2026 发表研究原型 AgentHands,利用 LLM 推理与 XR 空间感知,使 AI 智能体能生成与语音同步的具身手势。该系统通过环境注册、手势库及实时解析,将抽象指令转化为直观物理演示,显著提升用户在兰花护理等场景中的空间理解能力。
Google Research 推出 Biomarker Discovery Framework,这是一个在人类监督下运行的多智能体系统,用于从可穿戴传感器数据中优先筛选候选生物标志物。该系统结合假设生成、统计分析与对抗验证,在三个队列(N=9,279)中识别出41个心理健康和25个代谢疾病候选数字生物标志物,并恢复了已知临床信号。
Google DeepMind 回顾从 Atari DQN 到 AlphaGo、AlphaStar 及 AlphaFold 的游戏 AI 突破历程。其基于 Gemini 的 SIMA 2 智能体无需 API 即可在《No Man's Sky》等游戏中实现类人实时交互与推理。团队现与 Fenris Creations 合作,共同开发《EVE Universe》的新游戏玩法原型。
Google Research 推出 Mobility-Embedded POIs (ME-POIs) 框架,将匿名化移动模式与文本描述融合以增强地点表示。该框架在预测访问意图、价格等级分类及繁忙程度估算上分别实现 81.9%、75.1% 和 24.7% 的相对性能提升。
Google Research 发布 PhotoScan,一种基于深度学习的框架,可直接从标准 2D 智能手机照片估算体脂率、A/G 比和 V/S 比。该模型在 UK Biobank 数据上预训练并在独立队列验证中表现出接近 DXA 扫描的精度,其体脂率预测平均绝对误差为 2.15,优于智能手表的生物电阻抗分析传感器。
Google DeepMind 发布 Gemini 3.7 Flash,这是其针对编码和智能体任务的最强主力模型。该版本在 FrontierCode 1.1 Main(43.6% vs 34.4%)和 DeepSWE v1.1(65.3% vs 49.0%)等基准上显著优于前代,并支持更高效的 Web 开发工作流。
推荐理由:原文给出了新模型在编码与智能体任务上的具体基准提升及减半的入门价格,读者可据此评估其性价比。
Google DeepMind 推出大规模多语言手语转文本(SL2T)模型,首次将手语 AI 应用于 Gboard 和 Live Transcribe 等消费产品。
推荐理由:原文展示了 SL2T 模型在 Gboard 和 Live Transcribe 中的落地方式及隐私保护机制,读者可据此了解手语 AI 从实验室走向消费级产品的具体路径。
Google Research 引入“知识画像”行为框架和 WikiProfile 基准,区分大语言模型中的事实编码与检索能力。研究发现 Gemini-3-Pro 和 GPT-5 等前沿模型的事实编码率高达 95–98%,但仍有 26–34% 的已编码事实无法直接检索,表明事实性错误的瓶颈已从知识获取转向知识利用。
推荐理由:原文提出知识画像框架并构建 WikiProfile 基准,揭示前沿模型事实性错误主要源于检索失败而非编码缺失,为优化模型知识利用率提供新视角。
Google Research 推出基于 Gemini 和 Project Astra 的 AMIE (Video),该系统能在实时视频问诊中感知非语言线索并引导虚拟体格检查。
推荐理由:原文展示了AMIE在实时视频问诊中达到专家级表现的实验设计与结果,为理解多模态医疗AI的感知与推理能力提供了具体依据。
Google DeepMind 宣布开源 WeatherNext 2 和 WeatherNext Cyclones 模型,该系列 AI 模型在 Nature 发表论文显示其气旋路径、强度和风结构预测达到 SOTA 水平。
推荐理由:WeatherNext 在气旋预测中实现相当于十年气象进步的精度提升,并开源了模型权重与代码。
Google Research 发布论文提出 Chain-of-Evidence (CoE) 框架及 Science One Framework 原型,旨在解决 AI 自主科研中的可验证性问题。该框架通过构建原生证据链,实现了零幻影引用和完全可验证的评分,同时在 MLE-Bench 和 Parameter-Golf 等前沿基准测试中达到 SOTA 性能。
推荐理由:原文提出了基于证据链的可验证性框架,展示了在消除幻觉引用同时保持前沿基准性能的方法。
Google DeepMind 发布 Gemini Robotics ER 2,这是一款用于机器人的高级具身推理模型。该模型支持视频理解、任务编排和多机器人协作,在进度分类和时刻查找任务中分别达到 57.4% 和 91.3% 的准确率。开发者可通过 Gemini API 和 Google AI Studio 访问该模型。
推荐理由:原文给出了视频理解、任务编排和多机器人协作的具体能力指标,读者可以据此判断其在物理世界中的实际表现。