Google Research 推出 TurboQuant:实现零精度损失的极端压缩
Google Research 发布 TurboQuant 压缩算法,通过结合 PolarQuant 和 QJL 技术消除向量量化中的内存开销。该算法在 Gemma 和 Mistral 等开源 LLM 的 LongBench、RULER 等基准测试中,实现了 KV 缓存压缩且无精度损失,显著降低内存成本并提升检索速度。
Google Research 发布 TurboQuant 压缩算法,通过结合 PolarQuant 和 QJL 技术消除向量量化中的内存开销。该算法在 Gemma 和 Mistral 等开源 LLM 的 LongBench、RULER 等基准测试中,实现了 KV 缓存压缩且无精度损失,显著降低内存成本并提升检索速度。
Google Research 在 Earth AI 计划中推出 S2Vec,这是一种用于学习环境通用嵌入的自监督框架。该模型利用 S2 Geometry 栅格化地理数据并通过掩码自动编码(MAE)进行训练,无需人工标签即可预测人口密度等社会经济指标。评估显示,S2Vec 在社会经济预测任务中与基于图像的基线方法表现相当,尤其在地理外推方面具有优势。
Google Research 在 The Check Up 活动中概述了其 AI 技术在医疗健康领域的最新突破,涵盖个性化护理、临床协作、开发者生态、公共卫生及生物医学发现五大方向。
Google Research 与英国国家医疗服务体系(NHS)合作开展 AIMS 研究,并在 Nature Cancer 发表两项伴生研究,评估基于 AI 的乳腺癌检测系统在筛查工作流中的表现。
推荐理由:Google Research 联合 NHS 发表两项 Nature Cancer 研究,证实 AI 在乳腺癌筛查中可提升检出率并显著降低放射科医生工作负荷。
Google DeepMind 发布新论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出基于认知科学的 AGI 评估框架。
Google Research 联合康奈尔大学测试六款 LLM 回答高温超导专家级问题的能力,发现 NotebookLM 和定制 RAG 系统表现最佳。该研究发表于 PNAS,旨在探索 AI 作为科研思维伙伴的潜力,结果显示封闭数据源比开放网络访问更能保证科学准确性。
Google Research 宣布在 Flood Hub 平台上线基于 AI 的城市山洪预报功能,可提前 24 小时预测风险。该模型利用 Gemini 从公开新闻报道中提取历史洪水事件以构建 Groundsource 数据集,解决了缺乏物理水位计数据的难题。
推荐理由:原文介绍了基于新闻数据构建训练集并实现全球城市洪水预测的技术路径,展示了在缺乏传统水文监测地区的应用潜力。
Google Research 发布 Groundsource 方法,利用 Gemini 大模型从全球新闻中提取非结构化信息,构建包含 260 万条记录的城市山洪开放数据集。该方法通过分类、时间推理和空间定位技术处理 80 种语言的报道,经人工验证 82% 的数据具备实际分析价值,并已在 Google Flood Hub 中用于提供提前 24 小时的近全球城市山洪预报。
推荐理由:该研究利用 Gemini 从新闻中提取结构化洪水数据,解决了历史观测缺失问题,为灾害预测提供了新范式。
Google Research与Beth Israel Deaconess Medical Center合作完成了一项关于AMIE对话式诊断AI的前瞻性单中心可行性研究。
推荐理由:原文披露了AMIE在真实临床环境中的首次前瞻性可行性研究结果,展示了其在监督下的安全性及诊断准确率数据。
Google DeepMind CEO Demis Hassabis 发表文章纪念 AlphaGo 击败围棋世界冠军十周年,阐述该成就如何开启现代 AI 时代并推动科学突破。
Google Research 推出 WAXAL,包含约1846小时ASR转录数据和565小时TTS高保真录音,覆盖27种撒哈拉以南非洲语言。该数据集采用 CC-BY-4.0 许可开源,由非洲学术与社区组织主导采集,旨在支持超1亿使用者的语音技术研发。
Google Research 发布开源 AI 模型 SpeciesNet,利用 6500 万张标注图像训练,能自动识别相机陷阱照片中的 2498 类动物。该模型在标准笔记本上日处理约 30,000 张图片,对含动物图像的检出率达 99.4%,物种级分类准确率为 94.5%。作为 Google Earth AI 的一部分,SpeciesNet 已支持全球多个保护项目加速野生动物监测与分析。
Google Research 提出“贝叶斯教学”框架,通过监督微调使大语言模型模仿贝叶斯模型的最优概率更新策略。该方法显著提升了LLM在个性化推荐任务中的表现,并证明其能将学到的推理技能泛化至其他领域,克服了默认启发式算法的局限。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,这是其最快且最具成本效益的 Gemini 3 系列模型,现已通过 Gemini API 和 Vertex AI 向开发者和企业开放预览。
推荐理由:官方公布 Gemini 3.1 Flash-Lite 的定价、速度提升及基准测试数据,为高并发场景下的模型选型提供具体参考。
Google DeepMind 发布最新图像生成模型 Nano Banana 2(即 Gemini 3.1 Flash Image),旨在以 Flash 级别的速度提供接近 Pro 版本的智能与视觉质量。
推荐理由:原文详细列出了新模型在速度、世界知识及创作控制上的具体能力升级,并明确了其在 Google 全系产品中的部署范围。
Google DeepMind 正式发布 Gemini 3.1 Pro,作为 Gemini 3 系列的核心智能升级版本。该模型在 ARC-AGI-2 基准测试中取得 77.1% 的验证分数,推理性能较前代提升超过一倍。
推荐理由:原文披露了 Gemini 3.1 Pro 在 ARC-AGI-2 基准上的具体得分及全平台开放入口,读者可据此评估其推理能力跃升幅度与当前可用性。
IBM Research与UC Berkeley合作发布研究,引入多智能体系统失败分类法(MAST)分析IT-Bench基准测试中的执行轨迹,旨在解决传统基准仅报告成功率而无法解释失败原因的“黑盒”问题。
推荐理由:IBM与UC Berkeley联合提出MAST框架,通过细粒度失败模式分类揭示企业级智能体在IT自动化任务中的具体故障原因及修复策略。
Gemini 应用现已在 beta 阶段集成 Google DeepMind 最新的生成式音乐模型 Lyria 3,允许用户通过文本描述或上传图片视频生成 30 秒的高质量音轨。
推荐理由:Gemini 应用集成 Lyria 3 模型,支持通过文本或图片生成带歌词的 30 秒音乐,并嵌入 SynthID 水印以增强 AI 内容可识别性。
Google Research 推出 MapTrace,通过自动化流水线生成 200 万问答对以解决 MLLM 在地图路径追踪上的空间推理缺陷。该方案利用 Gemini 2.5 Pro 和 Imagen-4 构建含“Mask Critic”与“Path Critic”的合成数据管线,开源数据集旨在显式教授模型几何拓扑关系,弥补预训练模型缺乏物理世界导航规则的短板。
Google DeepMind 宣布与印度政府建立国家 AI 伙伴关系,提供 AlphaGenome、AI Co-scientist 等前沿模型以加速科学发现。
Google DeepMind 发布 Gemini 3 Deep Think 的重大升级,该专用推理模式旨在解决科学、研究和工程领域的现代挑战。新版本在 Humanity’s Last Exam(48.4%)、ARC-AGI-2(84.6%)和 Codeforces(Elo 3455)等基准测试中创下新高,并在国际物理和化学奥林匹克笔试部分达到金牌水平。
推荐理由:官方公布了Deep Think在科学、工程和数学基准上的最新性能数据及API开放计划,为评估其解决复杂现实问题的能力提供了具体依据。
Google Research 在 SPAA 2025 发表研究,针对云环境中时变容量下的非抢占式作业调度,提出了首个常数因子近似算法。离线场景下,Greedy 策略在单位利润时达到 1/2-approximation,不同利润时通过 primal-dual 框架实现 1/4-approximation。
Google Research 推出开源原型框架 DialogLab,旨在创作、模拟和测试动态人机群聊。该工具在 ACM UIST 2025 展示,通过“作者-测试-验证”工作流平衡脚本结构与实时即兴对话。14 名用户评估显示,其“人工控制”模式比自主或反应式代理更具吸引力和真实性。
Google DeepMind 发布的 Perch 2.0 生物声学基础模型虽主要基于鸟类训练,但在海洋任务中表现优异。最新论文证实该模型可通过迁移学习有效分类鲸鱼发声,无需水下音频训练数据。团队已在 Google Colab 提供端到端教程,演示利用 NOAA 数据构建自定义分类器。
Google DeepMind 发布两篇研究论文,展示 Gemini Deep Think 模式在专家指导下解决数学、物理和计算机科学领域专业研究问题的能力。
推荐理由:原文展示了 Gemini Deep Think 在纯数学、物理和计算机科学领域的具体科研突破案例及人机协作方法论,为评估 AI 在专业科研中的实际能力提供了详实依据。
Google Research 推出 Natively Adaptive Interfaces (NAI) 框架,通过多模态 AI 将静态导航转化为动态、代理驱动的模块。该方案利用 Gemini 处理语音、视觉和文本,构建出 StreetReaderAI 等原型,实现实时交互式音频描述与环境查询。
Google Research 推出 Sequential Attention,利用贪心选择与注意力评分在单次训练中实现自适应子集选择。该方法解决了特征选择的 NP-hard 难题,在多个神经网络基准测试中达到 SOTA 效果,显著降低训练开销并提升模型效率与可解释性。
Google Research 宣布与 Included Health 合作,启动一项待 IRB 批准的全美前瞻性随机研究,以评估对话式 AI 在真实世界虚拟护理工作流中的表现。
推荐理由:原文披露了从模拟验证到全美随机对照试验的研究路径,展示了医疗AI在真实临床工作流中评估安全性与效用的具体方法论。
Google DeepMind 即日起向美国 Google AI Ultra 订阅用户(18+)推出实验性研究原型 Project Genie。该应用由 Genie 3、Nano Banana Pro 和 Gemini 驱动,支持通过文本或图像提示创建、探索及混剪可交互的沉浸式世界,并能在移动时实时生成前方路径。
推荐理由:官方开放了基于 Genie 3 的交互式世界原型,明确了实时生成路径与物理模拟的能力边界及当前限制。
Google Research 发布新论文《Towards a Science of Scaling Agent Systems》,挑战“更多智能体更好”的假设,提出首个量化扩展原则。
推荐理由:通过180种配置的大规模评估,量化了多智能体系统在并行与串行任务中的性能差异及错误放大机制。
Google Research 发布 ATLAS,基于 774 次训练、10M–8B 参数模型及 400+ 种语言数据,提出自适应迁移缩放定律以优化多语言预训练。该研究量化了语言间协同效应,指出支持两倍语言数量需将模型规模扩大 1.18 倍、数据量增加 1.66 倍。ATLAS 为构建者提供了平衡语言混合与模型效率的数据驱动指南,并在 ICLR 2026 展示。
Google Research 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,通过平衡数据多样性与效用解决大规模数据集子集选择难题。该算法采用双准则贪心策略近似求解最大独立集问题,在图像分类等任务中超越 SOTA 基准,并提供解质量的数学保证。
Google Research 在 EMNLP 2025 发表研究,提出通过分解屏幕摘要与意图提取两阶段流程,使小多模态大语言模型实现设备端用户意图理解。该方法在 Gemini 和 Qwen2 基座模型上验证,其中 Gemini 1.5 Flash 8B 以更低成本和速度达到接近 Gemini 1.5 Pro 的性能表现。
Google DeepMind 发布 D4RT,一种统一 AI 模型用于动态场景的 4D 重建和追踪。该模型采用基于查询的 Transformer 架构,比先前方法快 18x 至 300x,在单个 TPU 上处理一分钟视频仅需约五秒。
Google Research 开发基于时间卷积网络(TCN)的多头深度学习模型,利用 Pixel Watch 的 IMU 数据直接估算步速、步长等时空步态指标。在包含 246 名参与者和约 70,000 个步行片段的大规模验证中,该方法的皮尔逊相关系数和组内相关系数均超过 0.80,性能与智能手机方案相当。
Google Research 证实通过 Android Auto 收集的急刹车事件(HBE)与道路碰撞率呈显著正相关,可作为交通安全评估的领先指标。分析显示 HBE 数据密度是碰撞报告的 18 倍,能填补稀疏历史数据的空白并实时识别高风险路段。该发现支持将连接车辆数据整合至 Google Maps Platform 的道路管理洞察中,以替代传统滞后的事故统计进行网络级安全评估。
Google Research 发布 MedGemma 1.5 4B 模型和 MedASR 语音识别模型,并启动 Kaggle 黑客松。MedGemma 1.5 新增对 CT、MRI 和全切片病理图像等高维医学影像的解读能力,在内部基准测试中疾病分类准确率较上一代显著提升;MedASR 专为医疗听写微调,错误率远低于通用 Whisper large-v3 模型。
推荐理由:原文给出了MedGemma 1.5对CT和MRI等高维医学影像的支持及具体基准提升,开发者可据此评估其在复杂医疗场景中的适配潜力。
Google Quantum AI 在 Nature Physics 发表研究,实验演示了基于 Willow 处理器的动态表面码。该方案通过交替电路结构解决泄漏与硬件约束问题,其中六边形晶格代码在距离从 3 扩展到 5 时逻辑错误率改善 2.15 倍,模拟显示误差抑制因子提升 15%。
Google DeepMind 发布 Veo 3.1 Ingredients to Video 功能更新,提升了基于参考图像生成视频的创意表现与角色一致性。此次更新首次支持原生 9:16 竖屏视频生成,并引入至 1080p 和 4K 分辨率的尖端升频技术。
推荐理由:原文详述了 Veo 3.1 在角色一致性、原生竖屏输出及高分辨率升级方面的具体改进,为移动端创作和专业工作流提供了新的能力参考。
Google Research 在 Science Advances 发表新论文,介绍其混合大气模型 NeuralGCM 如何通过直接基于卫星降水观测数据进行训练,从而改进长期全球降水模拟。该模型在 280 km 分辨率下,相比传统物理模型,在平均降水、极端降水(特别是前 0.1% 降雨量)及日循环再现方面均取得显著提升,误差降低约 40%。