跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

125条精选相关主题图像生成AI 视频语音与音频

最新精选

第 41–60 条 · 共 125 条
4月30日周四
  1. Google DeepMind82

    Google DeepMind 发布 AI co-clinician 研究:探索多模态医疗智能体与医生协作模式

    Google DeepMind 宣布启动 AI co-clinician 研究计划,旨在通过“三元护理”模式让 AI 在医生监督下协助患者。该系统在 98 个初级保健查询中实现 97 例无关键错误,并在开放式药物问答基准上超越现有前沿模型。

    推荐理由:原文披露了AI co-clinician在真实临床查询中的零关键错误率及多模态实时交互能力,展示了其作为辅助工具而非替代者的具体边界。

4月28日周二
  1. Hugging Face Blog78

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,这是一款支持文本、图像、视频和音频的全模态理解模型。该模型采用 Mamba-Transformer MoE 混合骨干网络,在 OCRBenchV2 和 WorldSense 等基准测试中表现优异,并针对长文档分析和智能体计算机使用进行了优化。BF16、FP8 和 NVFP4 检查点已在 Hugging Face 开放下载。

    推荐理由:原文给出了混合架构细节与多基准实测数据,读者可以据此评估其在长文档和音视频联合理解任务中的实际能力边界。

4月23日周四
4月16日周四
  1. Hugging Face Blog60

    Sentence Transformers 多模态嵌入与重排序模型微调教程

    Sentence Transformers 库支持对处理文本、图像、音频和视频的多模态嵌入及重排序模型进行训练或微调。以 Qwen3-VL-Embedding-2B 为例,通过 Visual Document Retrieval 数据集微调后,NDCG@10 从 0.888 提升至 0.947,性能超越参数量大其 4 倍的现有模型。

    推荐理由:原文提供了微调多模态嵌入模型的具体代码和Matryoshka训练策略,读者可据此复现视觉文档检索任务并优化部署效率。

4月13日周一
  1. Google DeepMind73

    Google DeepMind 发布 Gemini Robotics-ER 1.6 增强机器人具身推理能力

    Google DeepMind 推出 Gemini Robotics-ER 1.6,这是一款专为机器人设计的高层推理模型,显著提升了空间推理和多视角理解能力。该模型新增了仪表读取功能,能够解读复杂压力表和液位计,并在指向、计数及任务成功检测方面优于前代版本。

    推荐理由:官方详细拆解了空间推理与仪表读取等核心能力,并给出了 API 入口及开发者示例,适合评估其在工业巡检场景的落地潜力。

4月9日周四
  1. Hugging Face Blog70

    Sentence Transformers v5.4 发布:支持多模态嵌入与重排序模型

    Sentence Transformers 库发布 v5.4 版本,新增对文本、图像、音频和视频的多模态嵌入及重排序支持。用户可通过熟悉的 API 进行跨模态相似度计算和混合模态文档排名,适用于视觉文档检索和多模态 RAG 场景。该版本集成了 Qwen3-VL、NVIDIA Nemotron 等主流多模态模型,并提供了详细的安装指南和使用示例。

    推荐理由:Sentence Transformers v5.4 引入多模态嵌入与重排序能力,开发者可用统一 API 处理文本、图像及音视频,简化跨模态检索流程。

4月3日周五
  1. Google DeepMind90

    Google DeepMind 发布 Gemma 4:号称每字节性能最强的开源模型家族

    Google DeepMind 正式推出 Gemma 4 系列开源大模型,包含 E2B、E4B、26B MoE 和 31B Dense 四种规格,采用 Apache 2.0 许可证。

    推荐理由:Google DeepMind 发布 Gemma 4 系列开源模型,提供从移动端到工作站的多种尺寸及 Apache 2.0 许可,展示了其在智能体工作流和边缘计算上的最新进展。

4月2日周四
  1. Hugging Face Blog96

    Gemma 4 系列多模态模型发布

    Gemma 4 系列多模态模型正式发布,包含 E2B、E4B、12B Unified、31B 和 26B A4B 五种尺寸,支持图像、文本和音频输入,采用 Apache 2.0 许可证。

    推荐理由:原文给出了五种尺寸的多模态架构细节与跨框架部署方案,读者可据此评估其在端侧推理和智能体工作流中的实际可用性。

4月1日周三
  1. Hugging Face Blog70

    TII 发布 Falcon Perception 0.6B 早期融合模型及 Falcon OCR 0.3B 模型

    Technology Innovation Institute (TII) 发布 Falcon Perception(0.6B 参数)和 Falcon OCR(0.3B 参数),两者均采用单一早期融合 Transformer 架构处理图像补丁与文本。

    推荐理由:原文展示了早期融合架构在开放词汇分割与OCR任务上的性能优势及推理细节,为小参数模型替代复杂视觉管线提供了可复用的技术路径。

3月29日周日
  1. Google DeepMind65

    Google DeepMind 发布由 Gemini 驱动的 AI 指针实验功能

    Google DeepMind 推出由 Gemini 驱动的 AI 指针实验演示,旨在让光标具备理解用户指向内容及意图的能力。该功能遵循四项交互原则,允许用户通过简单的指向和语音指令(如“显示路线”或“总结此段”)跨应用调用 AI,无需在独立窗口间切换。

    推荐理由:官方展示了基于 Gemini 的 AI 指针原型,将上下文理解融入光标交互,为 Chrome 和 Googlebook 带来无需复杂提示词的自然操作体验。

3月26日周四
  1. Google DeepMind68

    Google DeepMind 发布 Lyria 3 Pro 音乐生成模型

    Google DeepMind 推出 Lyria 3 Pro,这是其最先进的音乐生成模型,支持创建长达 3 分钟的曲目,并能理解前奏、主歌、副歌等音乐结构以提供更强的定制化和创意控制。

    推荐理由:Lyria 3 Pro 支持长达 3 分钟的曲目生成并具备结构感知能力,同时接入 Vertex AI、Gemini 等多个平台,为不同规模的用户提供了更精细的音乐创作控制。

3月18日周三
  1. Google Research80

    Google Research 与 NHS 合作发表研究:AI 辅助乳腺癌筛查提升检出率并减少人工阅片量

    Google Research 与英国国家医疗服务体系(NHS)合作开展 AIMS 研究,并在 Nature Cancer 发表两项伴生研究,评估基于 AI 的乳腺癌检测系统在筛查工作流中的表现。

    推荐理由:Google Research 联合 NHS 发表两项 Nature Cancer 研究,证实 AI 在乳腺癌筛查中可提升检出率并显著降低放射科医生工作负荷。

3月17日周二
3月12日周四
  1. Google Research78

    Google Flood Hub 推出 AI 驱动的城市山洪预报功能

    Google Research 宣布在 Flood Hub 平台上线基于 AI 的城市山洪预报功能,可提前 24 小时预测风险。该模型利用 Gemini 从公开新闻报道中提取历史洪水事件以构建 Groundsource 数据集,解决了缺乏物理水位计数据的难题。

    推荐理由:原文介绍了基于新闻数据构建训练集并实现全球城市洪水预测的技术路径,展示了在缺乏传统水文监测地区的应用潜力。

  2. Google Research70

    Google Research 推出 Groundsource:用 Gemini 将新闻报道转化为洪水历史数据

    Google Research 发布 Groundsource 方法,利用 Gemini 大模型从全球新闻中提取非结构化信息,构建包含 260 万条记录的城市山洪开放数据集。该方法通过分类、时间推理和空间定位技术处理 80 种语言的报道,经人工验证 82% 的数据具备实际分析价值,并已在 Google Flood Hub 中用于提供提前 24 小时的近全球城市山洪预报。

    推荐理由:该研究利用 Gemini 从新闻中提取结构化洪水数据,解决了历史观测缺失问题,为灾害预测提供了新范式。

3月4日周三
  1. Google DeepMind73

    Google DeepMind 发布 Gemini 3.1 Flash-Lite 模型

    Google DeepMind 推出 Gemini 3.1 Flash-Lite,这是其最快且最具成本效益的 Gemini 3 系列模型,现已通过 Gemini API 和 Vertex AI 向开发者和企业开放预览。

    推荐理由:官方公布 Gemini 3.1 Flash-Lite 的定价、速度提升及基准测试数据,为高并发场景下的模型选型提供具体参考。

2月20日周五
  1. Google DeepMind86

    Google DeepMind 发布 Gemini 3.1 Pro 模型

    Google DeepMind 正式发布 Gemini 3.1 Pro,作为 Gemini 3 系列的核心智能升级版本。该模型在 ARC-AGI-2 基准测试中取得 77.1% 的验证分数,推理性能较前代提升超过一倍。

    推荐理由:原文披露了 Gemini 3.1 Pro 在 ARC-AGI-2 基准上的具体得分及全平台开放入口,读者可据此评估其推理能力跃升幅度与当前可用性。

2月19日周四
  1. Google DeepMind75

    Gemini 应用推出 Lyria 3 音乐生成功能

    Gemini 应用现已在 beta 阶段集成 Google DeepMind 最新的生成式音乐模型 Lyria 3,允许用户通过文本描述或上传图片视频生成 30 秒的高质量音轨。

    推荐理由:Gemini 应用集成 Lyria 3 模型,支持通过文本或图片生成带歌词的 30 秒音乐,并嵌入 SynthID 水印以增强 AI 内容可识别性。