跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 81–100 条 · 共 114 条
1月28日周三
1月14日周三
  1. Google Research65

    Google 发布 MedGemma 1.5 4B 与 MedASR 开源医疗模型

    Google Research 发布 MedGemma 1.5 4B 模型和 MedASR 语音识别模型,并启动 Kaggle 黑客松。MedGemma 1.5 新增对 CT、MRI 和全切片病理图像等高维医学影像的解读能力,在内部基准测试中疾病分类准确率较上一代显著提升;MedASR 专为医疗听写微调,错误率远低于通用 Whisper large-v3 模型。

    推荐理由:原文给出了MedGemma 1.5对CT和MRI等高维医学影像的支持及具体基准提升,开发者可据此评估其在复杂医疗场景中的适配潜力。

  2. Google DeepMind68

    Google DeepMind 发布 Veo 3.1 Ingredients to Video 更新:增强一致性并支持原生竖屏

    Google DeepMind 发布 Veo 3.1 Ingredients to Video 功能更新,提升了基于参考图像生成视频的创意表现与角色一致性。此次更新首次支持原生 9:16 竖屏视频生成,并引入至 1080p 和 4K 分辨率的尖端升频技术。

    推荐理由:原文详述了 Veo 3.1 在角色一致性、原生竖屏输出及高分辨率升级方面的具体改进,为移动端创作和专业工作流提供了新的能力参考。

12月17日周三
  1. Google DeepMind86

    Google DeepMind 发布 Gemini 3 Flash:兼顾前沿智能与速度

    Google DeepMind 发布 Gemini 3 Flash,旨在以更低成本和更高速度提供接近 Pro 级别的前沿智能。该模型在 GPQA Diamond 得分 90.4%,SWE-bench Verified 得分 78%,比 Gemini 2.5 Pro 快 3 倍且平均少用 30% token。

    推荐理由:原文给出了 Gemini 3 Flash 在多项基准测试中的具体分数、定价及与上一代模型的性能对比,读者可据此评估其在速度与成本平衡上的实际竞争力。

12月16日周二
  1. Google Research65

    Google Research 推出 Gemini 驱动的 Paper Assistant Tool 为 STOC 2026 提供自动反馈

    Google Research 推出名为 Paper Assistant Tool (PAT) 的实验性工具,利用 Gemini 2.5 Deep Think 为 STOC 2026 的理论计算机科学论文提供提交前的自动反馈。

    推荐理由:原文披露了基于 Gemini 2.5 Deep Think 的 Paper Assistant Tool 在 STOC 2026 的实验数据,展示了 AI 辅助理论计算机科学论文预审核的实际效果与用户反馈。

12月13日周六
11月20日周四
  1. Google DeepMind63

    Google DeepMind 在 Gemini 应用中推出 AI 图像验证功能

    Google DeepMind 宣布在 Gemini 应用中引入 AI 图像验证功能,用户可通过上传图像询问是否由 Google AI 生成或编辑。该功能基于 SynthID 数字水印技术,结合模型推理提供内容背景信息。未来计划将验证范围扩展至视频和音频格式,并整合到搜索等更多平台中。

    推荐理由:官方介绍了在 Gemini 应用中集成 SynthID 水印检测的具体交互方式,为内容真实性验证提供了新的入口。

11月19日周三
  1. Google Research80

    Google Research 发布端到端实时语音到语音翻译模型

    Google Research 推出了一种创新的端到端语音到语音翻译(S2ST)模型,实现了仅2秒延迟的实时翻译,并能保留原始说话人的声音特征。该模型基于 AudioLM 框架和 SpectroStream 编解码技术,通过可扩展的时间同步数据获取管道进行训练,解决了传统级联系统延迟高、错误累积和缺乏个性化的问题。

    推荐理由:Google Research 发布了端到端实时语音到语音翻译模型,将延迟降至2秒并保留原声,已在 Google Meet 和 Pixel 10 中部署。

  2. Google Research82

    Google 推出 Generative UI:在 Gemini 和搜索中实现动态交互式界面

    Google Research 正式介绍 Generative UI(生成式用户界面)能力,该功能利用 AI 模型根据提示词动态生成网页、游戏或工具等完整交互体验,而非仅渲染静态内容。

    推荐理由:官方展示了基于 Gemini 3 的生成式 UI 技术,通过动态创建交互式界面替代静态文本输出,并已在搜索和助手应用中开启实验。

11月17日周一
  1. Google DeepMind78

    Google DeepMind 发布 WeatherNext 2 气象预报模型

    Google DeepMind 与 Google Research 联合发布最新气象预报模型 WeatherNext 2。该模型生成预报的速度比前代快 8 倍,分辨率提升至小时级,并能从单一输入预测数百种可能的气象情景。

    推荐理由:原文给出了预测速度、分辨率提升及数据开放入口,读者可据此评估其对气象决策和现有工作流的实际改变。

11月13日周四
  1. Google DeepMind65

    Google DeepMind 发布 SIMA 2:具备推理与自我学习能力的虚拟世界智能体

    Google DeepMind 推出新一代通用 AI 智能体 SIMA 2,通过集成 Gemini 模型实现从指令跟随到交互式游戏伙伴的跨越。SIMA 2 具备复杂推理、多模态理解及跨环境泛化能力,能在未训练过的游戏(如 ASKA)和 Genie 3 生成的全新世界中执行任务。该模型还引入了基于试错和反馈的自我改进循环,目前作为有限研究预览向部分学者和游戏开发者开放。

    推荐理由:官方展示了集成 Gemini 推理能力的 SIMA 2 在虚拟世界中的泛化与自我改进机制,为具身智能研究提供了新的技术路径参考。

11月5日周三
  1. Google Research68

    Google Research 发布太空可扩展 AI 基础设施系统设计预印本论文

    Google Research 发布名为 Project Suncatcher 的研究项目及相关预印本论文,提出构建由自由空间光链路连接的太阳能卫星星座以承载 Google TPUs 进行 AI 计算。

    推荐理由:Google Research 发布关于太空 AI 基础设施的预印本论文,详细论证了利用太阳能卫星星座承载 TPU 进行大规模计算的可行性与挑战。

10月31日周五
10月30日周四
  1. Google Research68

    Google Research 提出可证明隐私洞察系统以分析生成式 AI 使用

    Google Research 推出“可证明隐私洞察”(PPI)系统,利用大语言模型、差分隐私和可信执行环境分析非结构化生成式 AI 数据。该系统已在 Pixel Recorder 应用中部署,使用开源 Gemma 3 模型在 TEE 内对转录文本进行分类聚合,确保原始数据不离开安全边界且输出具备用户级差分隐私保证。相关代码及机密联邦分析栈已开源,允许外部验证服务器端处理仅执行隐私保护计算。

    推荐理由:原文详述了结合大语言模型、差分隐私与可信执行环境的可证明隐私洞察系统,为分析端侧生成式 AI 数据提供了兼顾透明度与用户级隐私保护的技术路径。

10月28日周二