跳到正文

#多模态

今日 0 条
9月29日周二
  1. Microsoft Research60

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,这是一个结合生物学世界模型与交互式工具链的 AI 研究系统,旨在连接模型、科学工具、文献及研究人员。该系统在胰腺导管腺癌(PDAC)研究中应用,仅用一个周末即完成了从缩小化合物搜索空间到确定候选药物的过程,并验证了多个排名靠前的化合物能驱动肿瘤细胞状态转变。

    推荐理由:微软研究院推出Quine,通过多模态世界模型与实验闭环加速生物发现,并在胰腺癌研究中验证了化合物筛选效率。

9月25日周五
  1. Google Research60

    Google Research 发布 AI 视频联合导演框架以自动化连贯长视频生成

    Google Research 推出名为“AI video co-director”的统一多智能体框架,旨在解决现有扩散模型在生成长篇叙事视频时面临的语义漂移和级联失败挑战。

    推荐理由:Google Research 提出基于 Gemini 和 Veo 的多智能体框架,通过全局优化和世界状态跟踪解决长视频生成的语义漂移问题。

  2. Google DeepMind73

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar 实时视觉化身功能

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频生成与原生对话模型结合,为企业用户提供具备实时视觉呈现的交互式 AI 体验。

    推荐理由:原文详述了实时视觉化身在对话中的同步机制与异步工具调用能力,为评估企业级多模态交互体验提供了具体技术细节。

9月24日周四
9月18日周五
9月16日周三
  1. Mistral AI60

    Mistral 与 Mozilla 合作为 Firefox Smart Window 提供 AI 支持

    Mistral AI 宣布与 Mozilla 达成合作,其模型将为 Firefox 的 AI 浏览助手 Smart Window(测试版)提供动力。该功能旨在帮助用户理解复杂搜索、记忆已关闭标签页内容并基于当前标签页获取信息,首批覆盖法国和北美用户,英国和德国将于今年晚些时候跟进。

    推荐理由:Mistral 模型接入 Firefox Smart Window,为浏览器 AI 助手提供隐私保护与多语言支持,展示了开源技术在消费级场景的落地路径。

  2. NVIDIA Blog42

    曼彻斯特大学利用 NVIDIA Earth-2 预测英国空气污染

    曼彻斯特大学团队使用 NVIDIA Earth-2 CorrDiff 模型,在 Isambard-AI 超算上仅用两天训练出覆盖全英、分辨率达 2-3 平方公里的空气污染预测模型。该工作流支持在 DGX Spark 桌面 AI 系统上进行推理和小规模重训,大幅降低算力门槛。团队计划开源训练数据与工作流,并探索结合边缘设备实现实时决策及面向医疗的主动预警应用。

9月10日周四
9月8日周二
  1. Google DeepMind73

    Google DeepMind 发布 AlphaGenome Atlas:人类基因组单核苷酸变异预测地图

    Google DeepMind 推出 AlphaGenome Atlas,这是一个包含人类基因组中90亿个单核苷酸变异分子效应预测的平台。该数据集规模达1 PB,并引入了结合 AlphaGenome 和 AlphaMissense 的 AVI 评分以辅助变异排序。目前该平台已通过网站门户、API 以及 Google Antigravity 技能向学术研究免费开放。

    推荐理由:原文提供了覆盖全基因组90亿变异的预测地图及免费访问入口,读者可据此评估其在罕见病解析与群体遗传学研究中的实际可用性。

9月3日周四
  1. Google DeepMind84

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 与 Google Research 联合发布 WeatherNext 3,这是其最新且最准确的全球天气 AI 模型。该模型直接利用实时静止卫星数据进行训练,每小时生成一次高分辨率预报,地表变量分辨率达 5 公里,较前代提升约五倍。

    推荐理由:该模型通过直接学习实时卫星数据实现了小时级高分辨率预报,并集成至 Google 核心产品生态。

  2. Hugging Face Blog60

    Hugging Face 发布 NeoMME 多模态编码器系列

    Hugging Face 推出 NeoMME 260M 和 800M 参数规模的多语言多模态编码器,采用单一双向 Transformer 处理文本与图像补丁。NeoMME-Retriever 在 ViDoRe v3 基准测试中表现优异,260M 版本吞吐量约为 ColModernVBERT 的两倍,并通过层级令牌池化和非对称量化将索引存储减少至每页 6 kB。

    推荐理由:原文展示了单Transformer架构在视觉文档检索中的效率突破,提供了从模型权重到代码示例的完整开源实现。

9月2日周三
  1. Google DeepMind78

    Google DeepMind 在 Gemini 中推出智能体视频理解功能

    Google DeepMind 宣布在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中推出智能体视频理解功能。该功能通过让模型主动决定观看内容、速度和模态来替代固定帧率的静态处理,使 token 消耗最多降低 88%,成本最多减少 66%,准确率提升最高达 7%。

    推荐理由:官方给出了视频理解从静态处理转向智能体动态检索的技术路径,并提供了具体的成本与精度优化数据。

9月1日周二
8月28日周五
8月26日周三
8月21日周五
8月18日周二
  1. Hugging Face Blog80

    Sentence Transformers v6.0 发布:原生支持多向量(Late Interaction)嵌入模型

    Sentence Transformers v6.0 新增 MultiVectorEncoder 模型类型,原生支持 ColBERT 风格的多向量(Late Interaction)检索。该更新允许直接加载 PyLate、Stanford-NLP ColBERT 及 colpali-engine 检查点,通过统一的 API 实现文本、视觉文档、音频和视频的高效检索与重排序。

    推荐理由:Sentence Transformers v6.0 原生支持多向量模型,统一了文本、图像及音视频的检索接口,提供了从加载到部署的完整实践指南。

8月17日周一
  1. Google Research42

    Google Research 推出 PhotoScan:利用智能手机图像估算身体成分以预测胰岛素抵抗

    Google Research 发布 PhotoScan,一种基于深度学习的框架,可直接从标准 2D 智能手机照片估算体脂率、A/G 比和 V/S 比。该模型在 UK Biobank 数据上预训练并在独立队列验证中表现出接近 DXA 扫描的精度,其体脂率预测平均绝对误差为 2.15,优于智能手表的生物电阻抗分析传感器。

8月13日周四
  1. Hugging Face Blog44

    OlmoEarth Studio 支持导出自定义嵌入向量用于下游分析

    OlmoEarth Studio 新增功能,允许用户计算并导出由开源 OlmoEarth 基础模型生成的嵌入向量。该功能提供 Nano、Tiny 和 Base 三种编码器变体,支持通过 UI 或 API 选择区域、时间范围及影像源,输出为 Cloud-Optimized GeoTIFFs (COGs)。这些轻量级向量适用于相似性搜索、分割等下游任务,且源码与权重已公开。

  2. Microsoft Research35

    MindTopo 基准揭示 VLMs 拓扑推理与规划能力差距

    Microsoft Research 推出 MindTopo 基准,评估多模态大模型在连续性、分离性、顺序、包围和结等拓扑概念上的理解能力。测试显示当前模型在静态图像识别上表现优于交互式规划任务,且整体性能远低于人类水平。这一发现表明模型难以在动作序列中维持一致的拓扑理解,为机器人及交互环境中的可靠决策提供了改进方向。

8月12日周三
  1. Microsoft Research42

    Microsoft Research 发布 CARE-X:结合辅助监督与强化学习的临床放射学 VLM

    Microsoft Research 推出研究模型 CARE-X,这是一个用于胸部 X 光解读的统一视觉语言模型。该模型结合生成式与判别式能力,利用 DAPO 强化学习优化临床正确性,并支持确定性测量工具以处理依赖精确测量的病症。CARE-X 已在 Narayana Health 的真实世界印度临床数据上进行验证,旨在提供兼具自由文本推理与校准诊断预测的灵活输出。

8月10日周一
  1. Hugging Face Blog92

    Meta 发布 Muse Glimmer:面向本地智能体的开源多模态模型

    Meta 发布 Muse Glimmer,这是一个专为本地智能体用例设计的 30B 参数多模态模型,采用 Apache 2.0 许可证开源。该模型由 Muse 蒸馏而来,包含 2B ViT 视觉编码器和 28B 文本解码器,支持图像、视频输入及多模态工具调用。

    推荐理由:原文给出了30B参数模型的架构细节、基准测试数据及在主流推理框架中的Day-0支持,读者可据此评估其在本地智能体场景下的实际部署能力。

8月4日周二
  1. Mistral AI73

    Mistral AI 发布 Shieldstral:3B 参数开源多模态安全分类器

    Mistral AI 发布 Shieldstral,这是一款 3B 参数的开源多模态安全分类器,在文本安全方面性能匹敌或超越体积达其 7 倍的模型,并在多模态审核基准上创下新纪录。

    推荐理由:原文展示了将内容审核转化为问答任务的新范式,读者可据此了解如何通过自然语言策略实现无需重训的灵活安全评估。

7月30日周四
  1. Google DeepMind76

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,这是一款用于机器人的高级具身推理模型。该模型支持视频理解、任务编排和多机器人协作,在进度分类和时刻查找任务中分别达到 57.4% 和 91.3% 的准确率。开发者可通过 Gemini API 和 Google AI Studio 访问该模型。

    推荐理由:原文给出了视频理解、任务编排和多机器人协作的具体能力指标,读者可以据此判断其在物理世界中的实际表现。

  2. Google DeepMind62

    Google DeepMind 发布 Lyria 3.5 并上线 Google Flow Music

    Google DeepMind 推出最新音乐生成模型 Lyria 3.5,并在 Google Flow Music 中开放使用。该版本提升了旋律结构的丰富度与自然感,改进了歌词生成的提示词遵循度和结构意识,增强了人声的情感表达与发音准确性,同时允许用户更便捷地控制输出节奏和时长。

    推荐理由:官方给出了音乐生成模型在旋律、歌词和人声上的具体改进点,并说明了创作控制能力的变化。

7月23日周四
  1. Google Research75

    Google Research 发布 SymptomAI:面向日常症状评估的对话式 AI 智能体研究

    Google Research 发表关于 SymptomAI 的研究论文,介绍了一种用于日常症状评估的对话式 AI 智能体。在一项涉及 13,917 名参与者的随机全国性研究中,SymptomAI 生成的鉴别诊断(DDx)在超过 50% 的案例中被临床专家优先选择,且准确率高于其他临床医生提供的诊断。

    推荐理由:原文展示了基于大规模真实用户对话的研究结果,提供了AI在症状评估中对比临床专家的表现数据及与可穿戴设备生物信号的关联分析。

7月21日周二
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型,旨在优化 AI 智能体的构建效率与成本。

    推荐理由:官方详细披露了新版 Flash 系列模型的 token 效率提升数据、具体定价及计算机使用能力内置情况,为开发者评估智能体工作流的成本与性能提供了直接依据。

7月16日周四
7月15日周三
7月13日周一
7月9日周四
  1. Google Research68

    Google Research 发布 SensorFM:面向可穿戴健康数据的通用智能基础模型

    Google Research 推出 SensorFM,这是一个在超过一万亿分钟无标签多模态传感器数据上预训练的大型传感器基础模型。该模型利用自适应和继承掩码(AIM)框架处理缺失数据,学习出可跨心血管、代谢、睡眠及心理健康迁移的通用生理表征。

    推荐理由:原文展示了基于万亿分钟无标签数据训练的基础模型,其生成的表征在多项健康任务中超越传统监督基线,为可穿戴设备从单一指标监测转向通用生理建模提供了技术路径。

7月1日周三
  1. Google DeepMind80

    Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash 并开放开发者接入

    Google DeepMind 正式发布 Nano Banana 2 Lite 和 Gemini Omni Flash,并在 Google AI Studio、Gemini API 及 Gemini Enterprise Agent Platform 向开发者开放。

    推荐理由:官方同步开放两款新模型的开发者接口,明确了各自的延迟、成本及能力边界,为构建图文视频混合工作流提供了具体选型依据。