Google Research 发布 WAXAL:覆盖27种非洲语言的开源语音数据集
Google Research 推出 WAXAL,包含约1846小时ASR转录数据和565小时TTS高保真录音,覆盖27种撒哈拉以南非洲语言。该数据集采用 CC-BY-4.0 许可开源,由非洲学术与社区组织主导采集,旨在支持超1亿使用者的语音技术研发。
Google Research 推出 WAXAL,包含约1846小时ASR转录数据和565小时TTS高保真录音,覆盖27种撒哈拉以南非洲语言。该数据集采用 CC-BY-4.0 许可开源,由非洲学术与社区组织主导采集,旨在支持超1亿使用者的语音技术研发。
OpenAI 推出 CoT-Control,发现推理模型难以有效控制其思维链。这一结果强化了将可监控性作为 AI 安全保障的重要性。
Google Research 提出“贝叶斯教学”框架,通过监督微调使大语言模型模仿贝叶斯模型的最优概率更新策略。该方法显著提升了LLM在个性化推荐任务中的表现,并证明其能将学到的推理技能泛化至其他领域,克服了默认启发式算法的局限。
一篇新预印本利用 GPT-5.2 Pro 协助推导并验证了量子引力中非零的引力子树级振幅,成功将单负振幅概念扩展至引力子。该研究展示了 AI 模型在辅助复杂物理理论计算与验证方面的具体应用价值。
Google Research 推出 MapTrace,通过自动化流水线生成 200 万问答对以解决 MLLM 在地图路径追踪上的空间推理缺陷。该方案利用 Gemini 2.5 Pro 和 Imagen-4 构建含“Mask Critic”与“Path Critic”的合成数据管线,开源数据集旨在显式教授模型几何拓扑关系,弥补预训练模型缺乏物理世界导航规则的短板。
Google Research 在 SPAA 2025 发表研究,针对云环境中时变容量下的非抢占式作业调度,提出了首个常数因子近似算法。离线场景下,Greedy 策略在单位利润时达到 1/2-approximation,不同利润时通过 primal-dual 框架实现 1/4-approximation。
Google Research 推出开源原型框架 DialogLab,旨在创作、模拟和测试动态人机群聊。该工具在 ACM UIST 2025 展示,通过“作者-测试-验证”工作流平衡脚本结构与实时即兴对话。14 名用户评估显示,其“人工控制”模式比自主或反应式代理更具吸引力和真实性。
Google DeepMind 发布的 Perch 2.0 生物声学基础模型虽主要基于鸟类训练,但在海洋任务中表现优异。最新论文证实该模型可通过迁移学习有效分类鲸鱼发声,无需水下音频训练数据。团队已在 Google Colab 提供端到端教程,演示利用 NOAA 数据构建自定义分类器。
Google DeepMind 发布两篇研究论文,展示 Gemini Deep Think 模式在专家指导下解决数学、物理和计算机科学领域专业研究问题的能力。
推荐理由:原文展示了 Gemini Deep Think 在纯数学、物理和计算机科学领域的具体科研突破案例及人机协作方法论,为评估 AI 在专业科研中的实际能力提供了详实依据。
Google Research 推出 Sequential Attention,利用贪心选择与注意力评分在单次训练中实现自适应子集选择。该方法解决了特征选择的 NP-hard 难题,在多个神经网络基准测试中达到 SOTA 效果,显著降低训练开销并提升模型效率与可解释性。
Google Research 宣布与 Included Health 合作,启动一项待 IRB 批准的全美前瞻性随机研究,以评估对话式 AI 在真实世界虚拟护理工作流中的表现。
推荐理由:原文披露了从模拟验证到全美随机对照试验的研究路径,展示了医疗AI在真实临床工作流中评估安全性与效用的具体方法论。
Google Research 发布新论文《Towards a Science of Scaling Agent Systems》,挑战“更多智能体更好”的假设,提出首个量化扩展原则。
推荐理由:通过180种配置的大规模评估,量化了多智能体系统在并行与串行任务中的性能差异及错误放大机制。
Google Research 发布 ATLAS,基于 774 次训练、10M–8B 参数模型及 400+ 种语言数据,提出自适应迁移缩放定律以优化多语言预训练。该研究量化了语言间协同效应,指出支持两倍语言数量需将模型规模扩大 1.18 倍、数据量增加 1.66 倍。ATLAS 为构建者提供了平衡语言混合与模型效率的数据驱动指南,并在 ICLR 2026 展示。
Google Research 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,通过平衡数据多样性与效用解决大规模数据集子集选择难题。该算法采用双准则贪心策略近似求解最大独立集问题,在图像分类等任务中超越 SOTA 基准,并提供解质量的数学保证。
Google Research 在 EMNLP 2025 发表研究,提出通过分解屏幕摘要与意图提取两阶段流程,使小多模态大语言模型实现设备端用户意图理解。该方法在 Gemini 和 Qwen2 基座模型上验证,其中 Gemini 1.5 Flash 8B 以更低成本和速度达到接近 Gemini 1.5 Pro 的性能表现。
Google DeepMind 发布 D4RT,一种统一 AI 模型用于动态场景的 4D 重建和追踪。该模型采用基于查询的 Transformer 架构,比先前方法快 18x 至 300x,在单个 TPU 上处理一分钟视频仅需约五秒。
Google Research 开发基于时间卷积网络(TCN)的多头深度学习模型,利用 Pixel Watch 的 IMU 数据直接估算步速、步长等时空步态指标。在包含 246 名参与者和约 70,000 个步行片段的大规模验证中,该方法的皮尔逊相关系数和组内相关系数均超过 0.80,性能与智能手机方案相当。
Google Research 证实通过 Android Auto 收集的急刹车事件(HBE)与道路碰撞率呈显著正相关,可作为交通安全评估的领先指标。分析显示 HBE 数据密度是碰撞报告的 18 倍,能填补稀疏历史数据的空白并实时识别高风险路段。该发现支持将连接车辆数据整合至 Google Maps Platform 的道路管理洞察中,以替代传统滞后的事故统计进行网络级安全评估。
Google Quantum AI 在 Nature Physics 发表研究,实验演示了基于 Willow 处理器的动态表面码。该方案通过交替电路结构解决泄漏与硬件约束问题,其中六边形晶格代码在距离从 3 扩展到 5 时逻辑错误率改善 2.15 倍,模拟显示误差抑制因子提升 15%。
Google Research 在 Science Advances 发表新论文,介绍其混合大气模型 NeuralGCM 如何通过直接基于卫星降水观测数据进行训练,从而改进长期全球降水模拟。该模型在 280 km 分辨率下,相比传统物理模型,在平均降水、极端降水(特别是前 0.1% 降雨量)及日循环再现方面均取得显著提升,误差降低约 40%。
Berkeley AI Research 在 NeurIPS 2025 发表研究,提出利用互信息直接评估和优化成像系统。该方法仅依赖噪声测量数据,无需任务特定解码器,即可预测彩色摄影、射电天文等四个领域的性能。优化后的设计匹配端到端方法效果,同时显著降低内存与计算需求。
Google Research 在 COLM 2025 发布 Urania 框架,利用差分隐私(DP)聚类与关键词提取从 LLM 对话中生成安全洞察。该方案通过数学化隐私预算 ε 确保单条对话不影响结果,相比 CLIO 等启发式方法提供更强的形式化隐私保证。
Google DeepMind 与 Kaggle 合作发布 FACTS Benchmark Suite,包含参数化、搜索、多模态及 Grounding v2 四个基准,共提供 3,513 个公开示例。
Google Research 推出 Titans 架构及 MIRAS 理论框架,结合 RNN 速度与 Transformer 精度实现测试时记忆。Titans 利用“惊讶度”指标动态更新参数,通过动量机制和自适应权重衰减管理长序列信息。MIRAS 将序列建模统一为关联内存模块,突破均方误差范式限制,支持实时适应无需离线重训练。
密歇根州立大学团队利用 AlphaFold 预测光合作用关键酶 GLYK 的三维结构,发现高温下其柔性环易失稳。研究人员借鉴嗜热藻类特征构建混合酶,成功使该酶在 65 °C 高温下保持稳定,为培育耐热作物提供新路径。
Google Research 在 NeurIPS 2025 上推出 Massive Sound Embedding Benchmark (MSEB),旨在标准化评估多模态模型的八项核心听觉能力。该基准包含新开源的 SVQ 数据集,涵盖 177,352 条跨 26 个地区、17 种语言的语音查询。实验显示当前声音表示远非通用,在所有任务中存在显著性能提升空间。
科学家利用 AlphaFold 结合冷冻电镜技术,成功绘制出构成“坏胆固醇”(LDL)骨架的关键蛋白 apoB100 的原子分辨率结构。这一发现揭示了 LDL 颗粒外部的笼状外壳形态,有助于深入理解动脉粥样硬化性心血管疾病(ASCVD)的致病机制,并为预防和治疗该全球头号死因提供新的研发方向。
Google Research 联合 Google DeepMind、WRI 和 IIASA 发布 Natural Forests of the World 2020 数据集及论文,提供全球首个区分天然林与其他树木覆盖的10米分辨率地图,验证准确率达92.2%。
Google Quantum AI 联合斯坦福等机构在 Nature 发表研究,提出 Decoded Quantum Interferometry (DQI) 量子算法。该算法将优化问题转化为解码问题,利用量子干涉寻找近似最优解。针对最优多项式交集(OPI)问题,DQI 仅需数百万次量子逻辑操作,而经典计算机需超过 $10^{23}$ 次运算。
Google DeepMind 在 Nature 发表研究,提出基于 SigLIP-SO400M 的三步对齐法,利用 THINGS 数据集生成 AligNet 以重构模型视觉表征。该方法使 AI 内部映射按人类认知层级有序组织,显著提升了系统的鲁棒性、泛化能力及可靠性。
Google Research 在 NeurIPS 2025 发表“Nested Learning”论文,提出一种新的机器学习范式,旨在通过统一模型架构与优化算法来解决大语言模型的灾难性遗忘问题。该范式将模型视为一组相互关联的多层级优化问题,利用连续记忆系统(CMS)实现不同频率的权重更新。基于此原理设计的自修改架构 Hope 在语言建模和长上下文推理任务中表现出优于现有 SOTA 模型的性能。
Google Research 发布 DS-STAR,通过文件分析、LLM 验证及迭代规划解决复杂数据科学任务。该智能体在 DABStep 基准测试中将准确率从 41.0% 提升至 45.2%,并在 KramaBench 和 DA-Code 上超越 AutoGen 等现有方法。
Google DeepMind 联合 World Resources Institute 推出基于 Vision Transformers 的森林砍伐风险预测基准,实现 30 米级高分辨率监测。同时发布利用 Graph Neural Net 和 AlphaEarth Foundations 生成的物种分布图谱,并更新动物声音分类模型 Perch 2.0,支持快速适配新物种识别以辅助生态保护。
Google Research 推出 ForestCast,利用基于 vision transformers 的深度学习模型和纯卫星数据预测森林砍伐风险。该方法无需易过时的地理空间输入,准确率匹配或超越现有方案,并发布了首个公开基准数据集以支持社区复现与改进。
Google Research 发布名为 Project Suncatcher 的研究项目及相关预印本论文,提出构建由自由空间光链路连接的太阳能卫星星座以承载 Google TPUs 进行 AI 计算。
推荐理由:Google Research 发布关于太空 AI 基础设施的预印本论文,详细论证了利用太阳能卫星星座承载 TPU 进行大规模计算的可行性与挑战。
Google Research 在 Research@ 活动中发布了多项最新研究突破,包括 Google Earth AI、DeepSomatic 和 Quantum Echoes。
推荐理由:原文汇总了地球AI、基因组学和量子计算领域的最新突破,展示了从基础模型到实际应用的完整闭环。
Google Research 推出“可证明隐私洞察”(PPI)系统,利用大语言模型、差分隐私和可信执行环境分析非结构化生成式 AI 数据。该系统已在 Pixel Recorder 应用中部署,使用开源 Gemma 3 模型在 TEE 内对转录文本进行分类聚合,确保原始数据不离开安全边界且输出具备用户级差分隐私保证。相关代码及机密联邦分析栈已开源,允许外部验证服务器端处理仅执行隐私保护计算。
推荐理由:原文详述了结合大语言模型、差分隐私与可信执行环境的可证明隐私洞察系统,为分析端侧生成式 AI 数据提供了兼顾透明度与用户级隐私保护的技术路径。
Google Research 在 UIST’25 会议上介绍了 StreetReaderAI,这是一个利用上下文感知实时 AI 和 Gemini 模型使 Google Street View 对盲人及低视力人群可访问的概念验证原型。
Hugging Face 发布 Retrieval Embedding Benchmark (RTEB) beta 版,旨在通过混合公开与私有数据集策略解决现有基准的过拟合问题。该基准覆盖 20 种语言及法律、医疗等企业领域,采用 NDCG@10 作为核心指标,以评估嵌入模型在未见数据上的真实泛化能力。
Hugging Face 推出 Smol2Operator 项目,展示如何将 SmolVLM2-2.2B-Instruct 从零基础转化为具备 GUI 操作能力的智能体。
推荐理由:展示了如何通过两阶段微调将无 GUI 能力的轻量级 VLM 转化为具备推理能力的智能体,并开源了完整训练配方和数据集。