Google DeepMind 发布 Lyria 3.5 并上线 Google Flow Music
Google DeepMind 推出最新音乐生成模型 Lyria 3.5,并在 Google Flow Music 中开放使用。该版本提升了旋律结构的丰富度与自然感,改进了歌词生成的提示词遵循度和结构意识,增强了人声的情感表达与发音准确性,同时允许用户更便捷地控制输出节奏和时长。
推荐理由:官方给出了音乐生成模型在旋律、歌词和人声上的具体改进点,并说明了创作控制能力的变化。
Google DeepMind 推出最新音乐生成模型 Lyria 3.5,并在 Google Flow Music 中开放使用。该版本提升了旋律结构的丰富度与自然感,改进了歌词生成的提示词遵循度和结构意识,增强了人声的情感表达与发音准确性,同时允许用户更便捷地控制输出节奏和时长。
推荐理由:官方给出了音乐生成模型在旋律、歌词和人声上的具体改进点,并说明了创作控制能力的变化。
Google DeepMind 推出 Gemini Robotics 2,通过三个核心模型赋予机器人全身运动控制、精细操作及多机协作能力。该系列包含用于视觉语言动作转换的 VLA 模型、负责高层推理规划的 ER 模型以及支持端侧快速适配新形态的 On-Device 模型。目前 ER 模型已在 Google AI Studio 开放,VLA 和端侧模型向早期合作伙伴提供访问权限。
推荐理由:原文展示了从上半身到全身控制的跨越,以及多机器人协作能力,为理解通用物理AI的演进路径提供了具体技术参照。
Google Research 发表关于 SymptomAI 的研究论文,介绍了一种用于日常症状评估的对话式 AI 智能体。在一项涉及 13,917 名参与者的随机全国性研究中,SymptomAI 生成的鉴别诊断(DDx)在超过 50% 的案例中被临床专家优先选择,且准确率高于其他临床医生提供的诊断。
推荐理由:原文展示了基于大规模真实用户对话的研究结果,提供了AI在症状评估中对比临床专家的表现数据及与可穿戴设备生物信号的关联分析。
Google Research 在 Nature 发表研究,利用强化学习框架让智能体从量子错误检测中持续调整数千个控制参数,解决计算与校准解耦瓶颈。该技术在 Willow 超导处理器上验证,使系统能在运行期间对抗漂移并稳定量子态,无需中断计算即可实时“调音”。
Google DeepMind 在 DOE Genesis Mission Summit 2026 上宣布追加 $40 million 的 AI tokens 和 cloud credits,以加速科学发现。
Google DeepMind 正式推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型,旨在优化 AI 智能体的构建效率与成本。
推荐理由:官方详细披露了新版 Flash 系列模型的 token 效率提升数据、具体定价及计算机使用能力内置情况,为开发者评估智能体工作流的成本与性能提供了直接依据。
Google DeepMind 推出 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量级网络安全模型,旨在快速查找、验证和修补软件漏洞。
推荐理由:原文披露了基于Flash微调的轻量级网络安全模型及其在漏洞发现与修复上的实测表现,读者可据此评估低成本高频扫描方案对现有防御体系的潜在价值。
Google DeepMind 和 Isomorphic Labs 公布其生物韧性方法,旨在防止模型被滥用并协助构建更具韧性的世界。双方在过去12个月推进了超过15个合作伙伴关系,涵盖政府、生物安全组织及研究团体。
推荐理由:Google DeepMind 与 Isomorphic Labs 联合阐述生物韧性策略,展示了 AI 在预防、检测和应对生物威胁中的具体应用路径。
Google Research 在 ICLR 2026 论文中揭示,扩散模型的“创造力”并非随机现象,而是神经网络训练中的“分数平滑”效应所致。该机制使去噪过程在训练数据点之间进行插值,从而生成新颖且合理的数据样本。
Google DeepMind 在 Atal Tinkering Labs (ATL) 启动 ATL Saathi 试点,这是一款由 Gemini 3.5 Flash 驱动的 Web 应用,旨在为教师提供全天候规划与培训支持。该工具利用 NotebookLM 整理课程材料,支持生成项目创意及多语言交互,首批覆盖 100 所试点学校以推动 AI 辅助教学。
Google Research 推出 SensorFM,这是一个在超过一万亿分钟无标签多模态传感器数据上预训练的大型传感器基础模型。该模型利用自适应和继承掩码(AIM)框架处理缺失数据,学习出可跨心血管、代谢、睡眠及心理健康迁移的通用生理表征。
推荐理由:原文展示了基于万亿分钟无标签数据训练的基础模型,其生成的表征在多项健康任务中超越传统监督基线,为可穿戴设备从单一指标监测转向通用生理建模提供了技术路径。
Google Research 联合发布首个大规模实证研究,证实通过 Google Maps 算法微调引导不足 2% 的车辆避开瓶颈路段,可显著提升全城交通效率。实验显示目标路段车速中位数提升约 2%,燃油消耗降低 0.5%-1.0%,每年每城可减少数千吨 CO2e 排放。该成果发表于《Nature Cities》,确立了从个体路径优化向协同路由范式演进的技术框架。
Google DeepMind 与电影制作公司 A24 宣布建立首个专注于研究的合作伙伴关系,旨在将前沿技术融入创意流程。Google 同时对 A24 进行了投资,双方将通过协作开发新工作流与技术,以拓展未来娱乐的可能性。
Hugging Face 和 Cerebras 联合演示了基于 Gemma 4 的实时语音到语音(Speech-to-Speech)AI 系统,旨在解决语音交互中的高延迟痛点。
推荐理由:展示了开源级联语音架构与高速推理结合后的低延迟表现,为实时交互应用提供了可复用的技术栈参考。
Google Research 发布覆盖全球 50+ 城市的建筑级屋顶反照率数据集,并通过新的 Heat Resilience Earth Engine App 开放访问。该数据融合 Sentinel-2 与 Airbus Pléiades Neo 影像,实现 30-cm 分辨率,RMSE 仅为 0.04。模型显示针对性冷屋顶规划可将全球城市极端高温降低最高 0.5°C。
Google DeepMind 正式发布 Nano Banana 2 Lite 和 Gemini Omni Flash,并在 Google AI Studio、Gemini API 及 Gemini Enterprise Agent Platform 向开发者开放。
推荐理由:官方同步开放两款新模型的开发者接口,明确了各自的延迟、成本及能力边界,为构建图文视频混合工作流提供了具体选型依据。
Google Research 发布专为表格数据分类和回归设计的零样本基础模型 TabFM。该模型将表格预测重构为上下文学习问题,利用混合注意力架构和在数亿合成数据集上的预训练,无需手动特征工程或超参数调整即可在单次前向传播中生成高质量预测。
推荐理由:Google Research 推出面向表格数据的零样本基础模型 TabFM,通过上下文学习消除传统监督模型的训练与调优瓶颈。
Google 推出新架构,将 Multi-Token Prediction (MTP) 头集成到冻结的 Gemini Nano v3 模型中,已在 Pixel 9/10 系列上线。该方案利用零拷贝架构复用主模型 KV cache,节省 130MB 内存,使文本生成速度提升超 50% 且保持输出完全一致。
Google Research 在 CIDR 发表线性弹性缓存方案,将页面驱逐建模为滑雪租赁问题,利用轻量级机器学习动态调整缓存大小。该技术在 Spanner 生产环境中使内存使用降低 15.5%,总拥有成本(TCO)减少约 5%,且 I/O 成本影响仅 0.5%。
Gemini-2.5 和 Qwen3-32B 在简单事实问答中启用推理可显著提升答案召回率。该现象由计算缓冲效应与事实启动机制共同驱动,前者通过增加生成 token 提供额外计算时间,后者利用相关事实作为语义桥梁辅助检索。
Google DeepMind 宣布将计算机使用(computer use)作为内置工具集成到 Gemini 3.5 Flash 中,此前该功能仅作为独立的 Gemini 2.5 模型提供。
推荐理由:原文说明计算机使用能力已原生集成至 Gemini 3.5 Flash,并提供了针对提示注入风险的对抗训练及企业级安全防护机制。
Transformers.js 正在实验性地集成 Chrome 团队提出的跨源存储(Cross-Origin Storage, COS)API,旨在解决不同 Web 应用间共享大型 AI 模型和 Wasm 运行时文件时的重复下载与存储隔离问题。
推荐理由:文章详细演示了如何利用跨源存储 API 解决浏览器端 AI 模型重复下载问题,提供了 Transformers.js 的具体集成代码与隐私控制策略。
Google DeepMind 联合英国政府推出基于 Gemini 的 AI 规划原型,旨在将住房申请处理时间缩短 50%。该工具通过数据整合、政策识别及报告起草辅助规划官员,同时保留人工最终决策权并记录审计轨迹。计划于 2027 年向全英议会推广,以加速实现 2029 年新建 150 万套住房的目标。
Google Research 基于 Earth AI 框架推出英国乡村矢量数据集,将高分辨率卫星影像转化为树篱、石墙等生态特征的精确清单。该方案利用 RSF Vision-Transformer 骨干网络处理超 130,000 km² 区域,解决传统像素地图无法支持碳核算与景观规划的难题。
Google DeepMind 发布 AI Control Roadmap,提出针对内部 AI 智能体的纵深防御框架,旨在应对模型对齐不完美时的安全风险。该框架借鉴 MITRE ATT&CK 标准,将未受信任的智能体视为潜在内部威胁,通过实时行为监控和分级响应机制来检测与阻止异常操作。
推荐理由:原文提出了将内部 AI 智能体视为潜在内部威胁的防御框架,并公开了基于百万条轨迹分析的监控实践细节。
Google Research 发布 JAMA Dermatology 研究,显示 AI 辅助工具使消费者识别皮肤疾病名称的准确率从 8% 提升至 23%,近三倍于传统搜索。尽管命名能力显著增强,用户在确定后续医疗步骤方面仍面临挑战,表明人类在利用 AI 进行健康决策时的认知因素至关重要。
Google 支持加州大学圣地亚哥分校部署由 2,000 部退役 Pixel 手机组成的计算集群,为研究人员提供低成本、低碳云服务。通过提取主板并替换为通用 Linux 系统,该平台利用 Kubernetes 管理容器化应用,旨在减少硬件制造产生的隐含碳排放。
Google Research 在 AISTATS 2026 上推出 Regularized f-Divergence Kernel Tests 框架,旨在解决大模型机器遗忘审计中传统两样本检验计算昂贵且统计效力不足的问题。
Google DeepMind 推出基于扩散模型的实验性开源模型 DiffusionGemma,在专用 GPU 上实现最高 4 倍的文本生成加速。该模型采用 Apache 2.0 许可证,拥有 26B 总参数但仅激活 3.8B 参数,支持双向注意力以优化代码填充和非线性文本结构生成,目前主要面向追求低延迟的本地交互式应用场景。
推荐理由:该实验性模型通过并行生成机制将本地推理速度提升4倍,为开发者探索低延迟交互工作流提供了新的技术路径。
Google DeepMind 携手 Schmidt Sciences、Cooperative AI Foundation、ARIA 及 Google.org,宣布面向全球研究人员开放最高 $10M 的多智能体 AI 安全研究资助。
Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,支持自动检测 70 多种语言并生成保留说话人语调、节奏和音高的自然翻译语音。
推荐理由:该模型支持70多种语言的近实时语音到语音翻译,并已在开发者API、企业会议及消费级应用中开放体验。
Google DeepMind 发布 Gemma 4 12B,这是一款旨在笔记本电脑上运行的高性能多模态模型。它采用独特的无编码器统一架构,将视觉和音频输入直接融入 LLM 主干网络,支持原生音频输入。
推荐理由:该模型采用无编码器统一架构,在16GB显存设备上实现接近26B MoE的多模态推理能力,适合关注本地部署效率的开发者。
Google DeepMind 启动 Robotics Accelerator,从全欧选拔15家早期机器人初创公司。入选者将获3个月密集指导及 Gemini 机器人模型等技术资源支持。该计划旨在推动 AI 在物流、医疗等实体领域的落地应用。
Google DeepMind 公布在塞拉利昂进行的预注册随机对照试验结果,使用 Gemini 驱动的 Guided Learning 工具使学生在八周内数学成绩提升 0.258 个标准差,相当于 1.2 至 1.7 年的常规学习进度。
推荐理由:原文披露了塞拉利昂预注册试验数据,显示AI辅助教学显著提升数学成绩且学生主动寻求理解而非答案。
Google Research 在 Gemini Enterprise Agent Platform 中推出了由 Agentic RAG 驱动的跨语料检索功能,旨在解决传统单步 RAG 在处理多源、多跳商业查询时的局限性。
推荐理由:原文介绍了 Gemini Enterprise Agent Platform 中 Agentic RAG 的架构设计与实验数据,读者可了解其如何通过多智能体协作与充分上下文检查提升复杂查询的准确性。
Google Research 在 Nature 发表研究,推出名为 PHRM 的被动心率监测系统,利用智能手机前置摄像头在日常使用中估算心率和静息心率。该系统在实验室和真实场景下均达到 MAPE < 10% 的精度,且在不同肤色群体中表现一致,其每日静息心率估算误差小于 5 bpm,媲美可穿戴设备。
推荐理由:原文展示了基于智能手机前置摄像头的被动心率监测系统,提供了跨肤色的高精度验证数据及开源数据集,为无穿戴设备的心血管健康追踪提供了可复用的技术方案。
Google Research 在 GitHub 上开源了其水文建模框架,旨在帮助国家气象和水文服务机构将先进的 AI 洪水预测集成到自身工作流中。该 Python 包基于 PyTorch 实现,包含 LSTM 架构和训练管道,支持使用 Caravan 数据集及用户自定义的本地数据进行微调。
推荐理由:Google 开源水文模型框架,允许各国气象机构利用本地数据训练 AI 洪水预测模型,降低技术门槛并提升预警精度。
Google Research 在 I/O 2026 上发布了多项基于最新模型的研究成果和产品更新,重点推出了用于加速科学发现的 Gemini for Science 套件以及提升开发者效率的 Agentic 开发平台 Google Antigravity 2.0。
推荐理由:原文展示了从科学发现到开发者效率的全栈 AI 工具链,读者可据此了解 Google 如何将前沿研究转化为具体的生产力应用。
Google Research 推出结合密码学与硬件保护的零信任聚合方案,用于设备端 AI 的隐私分析。该方案采用新型单消息提交协议,克服传统多轮交互限制,并集成可信执行环境(TEE)提供严格证明与透明度。此设计确保仅获取匿名化群体洞察,防止个体用户数据泄露。
Google DeepMind 在亚太地区启动首届“AI for the Planet”加速器项目,旨在利用前沿 AI 解决气候、农业及能源等环境风险。该为期三个月的项目面向初创公司、研究团队和非营利组织,提供专家指导并协助集成 Google 的前沿 AI 与科学模型。项目将以新加坡线下训练营为起点,目前开放注册。