跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

125条精选相关主题图像生成AI 视频语音与音频

最新精选

第 21–40 条 · 共 125 条
7月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 Lyria 3.5 并上线 Google Flow Music

    Google DeepMind 推出最新音乐生成模型 Lyria 3.5,并在 Google Flow Music 中开放使用。该版本提升了旋律结构的丰富度与自然感,改进了歌词生成的提示词遵循度和结构意识,增强了人声的情感表达与发音准确性,同时允许用户更便捷地控制输出节奏和时长。

    推荐理由:官方给出了音乐生成模型在旋律、歌词和人声上的具体改进点,并说明了创作控制能力的变化。

7月23日周四
  1. Google Research75

    Google Research 发布 SymptomAI:面向日常症状评估的对话式 AI 智能体研究

    Google Research 发表关于 SymptomAI 的研究论文,介绍了一种用于日常症状评估的对话式 AI 智能体。在一项涉及 13,917 名参与者的随机全国性研究中,SymptomAI 生成的鉴别诊断(DDx)在超过 50% 的案例中被临床专家优先选择,且准确率高于其他临床医生提供的诊断。

    推荐理由:原文展示了基于大规模真实用户对话的研究结果,提供了AI在症状评估中对比临床专家的表现数据及与可穿戴设备生物信号的关联分析。

7月21日周二
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型,旨在优化 AI 智能体的构建效率与成本。

    推荐理由:官方详细披露了新版 Flash 系列模型的 token 效率提升数据、具体定价及计算机使用能力内置情况,为开发者评估智能体工作流的成本与性能提供了直接依据。

7月15日周三
7月9日周四
  1. Google Research68

    Google Research 发布 SensorFM:面向可穿戴健康数据的通用智能基础模型

    Google Research 推出 SensorFM,这是一个在超过一万亿分钟无标签多模态传感器数据上预训练的大型传感器基础模型。该模型利用自适应和继承掩码(AIM)框架处理缺失数据,学习出可跨心血管、代谢、睡眠及心理健康迁移的通用生理表征。

    推荐理由:原文展示了基于万亿分钟无标签数据训练的基础模型,其生成的表征在多项健康任务中超越传统监督基线,为可穿戴设备从单一指标监测转向通用生理建模提供了技术路径。

7月1日周三
  1. Google DeepMind80

    Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash 并开放开发者接入

    Google DeepMind 正式发布 Nano Banana 2 Lite 和 Gemini Omni Flash,并在 Google AI Studio、Gemini API 及 Gemini Enterprise Agent Platform 向开发者开放。

    推荐理由:官方同步开放两款新模型的开发者接口,明确了各自的延迟、成本及能力边界,为构建图文视频混合工作流提供了具体选型依据。

6月25日周四
  1. Google DeepMind78

    Gemini 3.5 Flash 原生集成计算机使用功能

    Google DeepMind 宣布将计算机使用(computer use)作为内置工具集成到 Gemini 3.5 Flash 中,此前该功能仅作为独立的 Gemini 2.5 模型提供。

    推荐理由:原文说明计算机使用能力已原生集成至 Gemini 3.5 Flash,并提供了针对提示注入风险的对抗训练及企业级安全防护机制。

6月9日周二
  1. Google DeepMind82

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款旨在笔记本电脑上运行的高性能多模态模型。它采用独特的无编码器统一架构,将视觉和音频输入直接融入 LLM 主干网络,支持原生音频输入。

    推荐理由:该模型采用无编码器统一架构,在16GB显存设备上实现接近26B MoE的多模态推理能力,适合关注本地部署效率的开发者。

  2. Hugging Face Blog75

    智能体通过串联两个 Hugging Face Spaces 构建 3D 巴黎画廊的实践

    作者演示了编码智能体如何通过读取 Gradio Space 暴露的 `agents.md` 文件,自动调用 `ideogram-ai/ideogram4` 生成图像并串联 `VAST-AI/TripoSplat` 进行 3D Gaussian splat 重建,最终部署为静态 Space。

    推荐理由:展示了利用 agents.md 让智能体自动串联图像生成与3D重建Space的完整流程,为构建多媒体应用提供了可复用的集成方法。

6月8日周一
  1. Google DeepMind68

    Google DeepMind 发布塞拉利昂 AI 辅助学习影响评估研究

    Google DeepMind 公布在塞拉利昂进行的预注册随机对照试验结果,使用 Gemini 驱动的 Guided Learning 工具使学生在八周内数学成绩提升 0.258 个标准差,相当于 1.2 至 1.7 年的常规学习进度。

    推荐理由:原文披露了塞拉利昂预注册试验数据,显示AI辅助教学显著提升数学成绩且学生主动寻求理解而非答案。

6月5日周五
  1. Google Research67

    Google Research 发布 PHRM:通过智能手机摄像头实现被动心率监测

    Google Research 在 Nature 发表研究,推出名为 PHRM 的被动心率监测系统,利用智能手机前置摄像头在日常使用中估算心率和静息心率。该系统在实验室和真实场景下均达到 MAPE < 10% 的精度,且在不同肤色群体中表现一致,其每日静息心率估算误差小于 5 bpm,媲美可穿戴设备。

    推荐理由:原文展示了基于智能手机前置摄像头的被动心率监测系统,提供了跨肤色的高精度验证数据及开源数据集,为无穿戴设备的心血管健康追踪提供了可复用的技术方案。

  2. Hugging Face Blog65

    NVIDIA 发布 Nemotron 3.5 Content Safety:支持自定义策略的多模态内容安全模型

    NVIDIA 发布 Nemotron 3.5 Content Safety,这是一个基于 Gemma 3 4B IT 微调的统一多模态、多语言内容安全模型。它支持自定义企业策略执行和可选的可审计推理轨迹(THINK Mode),在保持低延迟的同时实现了跨语言和图文的综合安全评估。

    推荐理由:该模型将多模态、多语言与自定义策略执行统一于单次推理,并开源了包含真实图像的训练数据集,为企业级内容安全提供了可审计且低延迟的解决方案。

5月18日周一
  1. Google DeepMind68

    Google DeepMind Project Genie 新增 Street View 实景锚定功能并向全球 Google AI Ultra 用户开放

    Google DeepMind 宣布其通用世界模型 Project Genie 新增基于 Google Street View 的实景锚定能力,允许用户选择美国境内的真实地点生成互动虚拟环境。

    推荐理由:Project Genie 接入 Street View 真实影像,让 AI 生成的虚拟环境能锚定现实地点,为智能体训练和创意探索提供新路径。

  2. Google DeepMind86

    Google DeepMind 发布 Gemini Omni Flash 模型

    Google DeepMind 推出 Gemini Omni Flash,这是 Omni 系列的首个模型,支持从图像、音频、视频和文本等任意输入生成高质量视频。

    推荐理由:原文详细说明了 Gemini Omni Flash 支持自然语言对话式视频编辑及多模态输入生成,并给出了具体的分发渠道和订阅权限。

5月17日周日
  1. Google DeepMind73

    Google DeepMind 发布 Gemini for Science 系列科研工具与技能

    Google DeepMind 正式推出 Gemini for Science,这是一套旨在扩展科学探索规模与精度的工具集合。该计划包含 Google Labs 上的三个实验性原型:基于 Co-Scientist 的假设生成、结合 AlphaEvolve 和 ERA 的计算发现,以及利用 NotebookLM 实现的文献洞察。

    推荐理由:Google DeepMind 推出 Gemini for Science,包含三个实验性工具和科学技能包,旨在通过 AI 智能体加速科学研究的核心步骤。

  2. Google DeepMind73

    Google DeepMind 扩展内容透明度工具并发布 AI 内容检测 API

    Google DeepMind 宣布在 Search、Gemini、Chrome、Pixel 和 Cloud 中扩展内容透明度和验证工具,以帮助用户理解网络内容的创建和编辑方式。

    推荐理由:官方详细说明了 SynthID 和 C2PA 在搜索、浏览器及云端的集成进展,并发布了新的 AI 内容检测 API,为开发者提供了识别生成内容的具体工具。

5月16日周六
  1. Google DeepMind73

    Google DeepMind 解析 WeatherNext 如何助力预测飓风梅丽莎历史性强登陆

    Google DeepMind 发布文章说明其 AI 天气模型 WeatherNext 协助美国国家飓风中心(NHC)成功预测了飓风梅丽莎的迅速增强和登陆。该模型在飓风仍为一级时,便以 80% 的置信度提前五天预测出其将以五级强度登陆牙买加,这是首次从如此低的风速起点成功预测达到五级强度的风暴。

    推荐理由:原文通过飓风梅丽莎案例,展示了 WeatherNext 在提前五天预测五级强度登陆方面的具体表现及与传统模型的对比优势。

  2. Google DeepMind92

    Google DeepMind 发布 Gemini 3.5 Flash 模型

    Google DeepMind 正式发布 Gemini 3.5 系列并率先推出 Gemini 3.5 Flash 模型,该模型主打智能体(Agent)与编码能力,现已向全球用户开放。

    推荐理由:官方详细披露了 Gemini 3.5 Flash 在智能体任务与编码基准上的性能数据及开放入口,为评估其实际工作流替代能力提供了具体依据。