Condé Nast 如何利用 Amazon Bedrock 构建多模态视频发现系统
Condé Nast 联合 AWS GenAIIC,基于 Amazon Bedrock 和 TwelveLabs Marengo 模型构建多模态视频发现方案。该方案利用语义搜索处理超14万视频库,将单次内容发现耗时从250分钟降至2分钟内。
Condé Nast 联合 AWS GenAIIC,基于 Amazon Bedrock 和 TwelveLabs Marengo 模型构建多模态视频发现方案。该方案利用语义搜索处理超14万视频库,将单次内容发现耗时从250分钟降至2分钟内。
微软研究院发布 Quine,这是一个结合生物学世界模型与交互式工具链的 AI 研究系统,旨在连接模型、科学工具、文献及研究人员。该系统在胰腺导管腺癌(PDAC)研究中应用,仅用一个周末即完成了从缩小化合物搜索空间到确定候选药物的过程,并验证了多个排名靠前的化合物能驱动肿瘤细胞状态转变。
推荐理由:微软研究院推出Quine,通过多模态世界模型与实验闭环加速生物发现,并在胰腺癌研究中验证了化合物筛选效率。
本教程演示如何利用 AWS vLLM-Omni Deep Learning Container (DLC) 在 Amazon SageMaker AI 上部署 Qwen3-TTS,实现文本输入与音频输出的双向流式传输。通过 Gradio 应用可体验该工作流,支持在生成完整响应前开始播放语音,适用于实时语音代理等场景。
Google Research 推出名为“AI video co-director”的统一多智能体框架,旨在解决现有扩散模型在生成长篇叙事视频时面临的语义漂移和级联失败挑战。
推荐理由:Google Research 提出基于 Gemini 和 Veo 的多智能体框架,通过全局优化和世界状态跟踪解决长视频生成的语义漂移问题。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将低延迟流式视频生成与原生对话模型结合,为企业用户提供具备实时视觉呈现的交互式 AI 体验。
推荐理由:原文详述了实时视觉化身在对话中的同步机制与异步工具调用能力,为评估企业级多模态交互体验提供了具体技术细节。
Hugging Face 推出针对视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型。该模型通过推测解码技术,在仅增加 8.9% 参数量的前提下,实现设备端最高 3.13 倍、H100 上 2.66 倍的解码加速。目前已支持 llama.cpp、MLX-VLM 和 SGLang,提供 Safetensors 和 GGUF 格式供开源部署。
Google Research 推出新研究实验,允许教师利用生成式用户界面(GenUI)创建定制化的交互式学习模拟器。该方案通过游戏化设计和教学护栏确保内容质量,目前已在 STEM 学科发布包含 30 多个由 AI 生成并经教师审核的示例库。
Mistral AI 宣布与 Mozilla 达成合作,其模型将为 Firefox 的 AI 浏览助手 Smart Window(测试版)提供动力。该功能旨在帮助用户理解复杂搜索、记忆已关闭标签页内容并基于当前标签页获取信息,首批覆盖法国和北美用户,英国和德国将于今年晚些时候跟进。
推荐理由:Mistral 模型接入 Firefox Smart Window,为浏览器 AI 助手提供隐私保护与多语言支持,展示了开源技术在消费级场景的落地路径。
曼彻斯特大学团队使用 NVIDIA Earth-2 CorrDiff 模型,在 Isambard-AI 超算上仅用两天训练出覆盖全英、分辨率达 2-3 平方公里的空气污染预测模型。该工作流支持在 DGX Spark 桌面 AI 系统上进行推理和小规模重训,大幅降低算力门槛。团队计划开源训练数据与工作流,并探索结合边缘设备实现实时决策及面向医疗的主动预警应用。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款最新实时对话模型,旨在提升语音智能体的近实时推理能力。
推荐理由:原文详细列出了两款新语音模型在多项基准测试中的具体得分及并行推理能力,为开发者评估实时语音智能体的性能与成本提供了直接依据。
Hugging Face 推出 Workflow1111,使用 Gradio Workflow 将 AUTOMATIC1111 的主要功能集重建为包含 73 个节点的单一工作流画布。
推荐理由:展示了用 Gradio Workflow 重构复杂图像生成工作流的路径,并说明了节点如何自动转化为 API 和 MCP 工具。
Google DeepMind 推出 AlphaGenome Atlas,这是一个包含人类基因组中90亿个单核苷酸变异分子效应预测的平台。该数据集规模达1 PB,并引入了结合 AlphaGenome 和 AlphaMissense 的 AVI 评分以辅助变异排序。目前该平台已通过网站门户、API 以及 Google Antigravity 技能向学术研究免费开放。
推荐理由:原文提供了覆盖全基因组90亿变异的预测地图及免费访问入口,读者可据此评估其在罕见病解析与群体遗传学研究中的实际可用性。
Google DeepMind 与 Google Research 联合发布 WeatherNext 3,这是其最新且最准确的全球天气 AI 模型。该模型直接利用实时静止卫星数据进行训练,每小时生成一次高分辨率预报,地表变量分辨率达 5 公里,较前代提升约五倍。
推荐理由:该模型通过直接学习实时卫星数据实现了小时级高分辨率预报,并集成至 Google 核心产品生态。
Hugging Face 推出 NeoMME 260M 和 800M 参数规模的多语言多模态编码器,采用单一双向 Transformer 处理文本与图像补丁。NeoMME-Retriever 在 ViDoRe v3 基准测试中表现优异,260M 版本吞吐量约为 ColModernVBERT 的两倍,并通过层级令牌池化和非对称量化将索引存储减少至每页 6 kB。
推荐理由:原文展示了单Transformer架构在视觉文档检索中的效率突破,提供了从模型权重到代码示例的完整开源实现。
Google Research 推出基于 Swin-S Transformer 的 MAPL-EMIT 框架,利用 EMIT 卫星数据自动检测全球甲烷羽流。该模型在专家标注数据上实现 84% 的高召回率,能同时完成增强量化、羽流分割和源定位。相关模型、合成数据及推理库已开源至 Kaggle 和 GitHub。
Google DeepMind 宣布在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中推出智能体视频理解功能。该功能通过让模型主动决定观看内容、速度和模态来替代固定帧率的静态处理,使 token 消耗最多降低 88%,成本最多减少 66%,准确率提升最高达 7%。
推荐理由:官方给出了视频理解从静态处理转向智能体动态检索的技术路径,并提供了具体的成本与精度优化数据。
Microsoft Research 推出开源病理基础模型 GigaPath-Flash 和 GigaTIME-Flash,旨在通过提升效率实现群体规模的疾病研究。
Google Research 推出实验性研究能力“行星预测引擎”(PPE),该系统能自主执行从数据发现到模型训练的完整地理空间建模工作流。PPE 通过智能数据选择、多模态数据集整理和自动模型构建三个阶段,将复杂预测模型的构建时间从数周缩短至几分钟。
Google DeepMind 推出 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 中提供工作室级视频生成能力。
推荐理由:原文详述了场景延长、首尾帧插值及4K升频等具体能力参数,为开发者评估生成式视频工作流的可控性与迭代效率提供了直接依据。
Google Research 在 CHI 2026 发表研究原型 AgentHands,利用 LLM 推理与 XR 空间感知,使 AI 智能体能生成与语音同步的具身手势。该系统通过环境注册、手势库及实时解析,将抽象指令转化为直观物理演示,显著提升用户在兰花护理等场景中的空间理解能力。
Google Research 推出 Mobility-Embedded POIs (ME-POIs) 框架,将匿名化移动模式与文本描述融合以增强地点表示。该框架在预测访问意图、价格等级分类及繁忙程度估算上分别实现 81.9%、75.1% 和 24.7% 的相对性能提升。
Sentence Transformers v6.0 新增 MultiVectorEncoder 模型类型,原生支持 ColBERT 风格的多向量(Late Interaction)检索。该更新允许直接加载 PyLate、Stanford-NLP ColBERT 及 colpali-engine 检查点,通过统一的 API 实现文本、视觉文档、音频和视频的高效检索与重排序。
推荐理由:Sentence Transformers v6.0 原生支持多向量模型,统一了文本、图像及音视频的检索接口,提供了从加载到部署的完整实践指南。
Google Research 发布 PhotoScan,一种基于深度学习的框架,可直接从标准 2D 智能手机照片估算体脂率、A/G 比和 V/S 比。该模型在 UK Biobank 数据上预训练并在独立队列验证中表现出接近 DXA 扫描的精度,其体脂率预测平均绝对误差为 2.15,优于智能手表的生物电阻抗分析传感器。
OlmoEarth Studio 新增功能,允许用户计算并导出由开源 OlmoEarth 基础模型生成的嵌入向量。该功能提供 Nano、Tiny 和 Base 三种编码器变体,支持通过 UI 或 API 选择区域、时间范围及影像源,输出为 Cloud-Optimized GeoTIFFs (COGs)。这些轻量级向量适用于相似性搜索、分割等下游任务,且源码与权重已公开。
Microsoft Research 推出 MindTopo 基准,评估多模态大模型在连续性、分离性、顺序、包围和结等拓扑概念上的理解能力。测试显示当前模型在静态图像识别上表现优于交互式规划任务,且整体性能远低于人类水平。这一发现表明模型难以在动作序列中维持一致的拓扑理解,为机器人及交互环境中的可靠决策提供了改进方向。
Google DeepMind 推出大规模多语言手语转文本(SL2T)模型,首次将手语 AI 应用于 Gboard 和 Live Transcribe 等消费产品。
推荐理由:原文展示了 SL2T 模型在 Gboard 和 Live Transcribe 中的落地方式及隐私保护机制,读者可据此了解手语 AI 从实验室走向消费级产品的具体路径。
Google Research 推出基于 Gemini 和 Project Astra 的 AMIE (Video),该系统能在实时视频问诊中感知非语言线索并引导虚拟体格检查。
推荐理由:原文展示了AMIE在实时视频问诊中达到专家级表现的实验设计与结果,为理解多模态医疗AI的感知与推理能力提供了具体依据。
Microsoft Research 推出研究模型 CARE-X,这是一个用于胸部 X 光解读的统一视觉语言模型。该模型结合生成式与判别式能力,利用 DAPO 强化学习优化临床正确性,并支持确定性测量工具以处理依赖精确测量的病症。CARE-X 已在 Narayana Health 的真实世界印度临床数据上进行验证,旨在提供兼具自由文本推理与校准诊断预测的灵活输出。
Meta 发布 Muse Glimmer,这是一个专为本地智能体用例设计的 30B 参数多模态模型,采用 Apache 2.0 许可证开源。该模型由 Muse 蒸馏而来,包含 2B ViT 视觉编码器和 28B 文本解码器,支持图像、视频输入及多模态工具调用。
推荐理由:原文给出了30B参数模型的架构细节、基准测试数据及在主流推理框架中的Day-0支持,读者可据此评估其在本地智能体场景下的实际部署能力。
Mistral AI 发布 Shieldstral,这是一款 3B 参数的开源多模态安全分类器,在文本安全方面性能匹敌或超越体积达其 7 倍的模型,并在多模态审核基准上创下新纪录。
推荐理由:原文展示了将内容审核转化为问答任务的新范式,读者可据此了解如何通过自然语言策略实现无需重训的灵活安全评估。
Google DeepMind 发布 Gemini Robotics ER 2,这是一款用于机器人的高级具身推理模型。该模型支持视频理解、任务编排和多机器人协作,在进度分类和时刻查找任务中分别达到 57.4% 和 91.3% 的准确率。开发者可通过 Gemini API 和 Google AI Studio 访问该模型。
推荐理由:原文给出了视频理解、任务编排和多机器人协作的具体能力指标,读者可以据此判断其在物理世界中的实际表现。
Google DeepMind 推出最新音乐生成模型 Lyria 3.5,并在 Google Flow Music 中开放使用。该版本提升了旋律结构的丰富度与自然感,改进了歌词生成的提示词遵循度和结构意识,增强了人声的情感表达与发音准确性,同时允许用户更便捷地控制输出节奏和时长。
推荐理由:官方给出了音乐生成模型在旋律、歌词和人声上的具体改进点,并说明了创作控制能力的变化。
Google Research 发表关于 SymptomAI 的研究论文,介绍了一种用于日常症状评估的对话式 AI 智能体。在一项涉及 13,917 名参与者的随机全国性研究中,SymptomAI 生成的鉴别诊断(DDx)在超过 50% 的案例中被临床专家优先选择,且准确率高于其他临床医生提供的诊断。
推荐理由:原文展示了基于大规模真实用户对话的研究结果,提供了AI在症状评估中对比临床专家的表现数据及与可穿戴设备生物信号的关联分析。
Google DeepMind 正式推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型,旨在优化 AI 智能体的构建效率与成本。
推荐理由:官方详细披露了新版 Flash 系列模型的 token 效率提升数据、具体定价及计算机使用能力内置情况,为开发者评估智能体工作流的成本与性能提供了直接依据。
DharmaOCR 通过领域专用训练,在巴西葡萄牙语识别任务中表现优于 Mistral OCR4 和 Unlimited-OCR。该模型采用监督微调与直接偏好优化(DPO)两阶段训练,集中参数资源于目标语言,从而在提取质量和推理稳定性上取得优势。
Thinking Machines Lab 在 Hugging Face 发布了 Inkling 系列开源多模态大模型,包含总参数约 1T 的 Inkling 和总参数 276B/激活 12B 的 Inkling-Small。
推荐理由:原文给出了1T参数全模态模型的架构细节与部署配置,读者可以据此评估其在多模态推理任务中的实际能力。
Google DeepMind 在 Atal Tinkering Labs (ATL) 启动 ATL Saathi 试点,这是一款由 Gemini 3.5 Flash 驱动的 Web 应用,旨在为教师提供全天候规划与培训支持。该工具利用 NotebookLM 整理课程材料,支持生成项目创意及多语言交互,首批覆盖 100 所试点学校以推动 AI 辅助教学。
Google Research 推出 SensorFM,这是一个在超过一万亿分钟无标签多模态传感器数据上预训练的大型传感器基础模型。该模型利用自适应和继承掩码(AIM)框架处理缺失数据,学习出可跨心血管、代谢、睡眠及心理健康迁移的通用生理表征。
推荐理由:原文展示了基于万亿分钟无标签数据训练的基础模型,其生成的表征在多项健康任务中超越传统监督基线,为可穿戴设备从单一指标监测转向通用生理建模提供了技术路径。
Hugging Face 和 Cerebras 联合演示了基于 Gemma 4 的实时语音到语音(Speech-to-Speech)AI 系统,旨在解决语音交互中的高延迟痛点。
推荐理由:展示了开源级联语音架构与高速推理结合后的低延迟表现,为实时交互应用提供了可复用的技术栈参考。
Google DeepMind 正式发布 Nano Banana 2 Lite 和 Gemini Omni Flash,并在 Google AI Studio、Gemini API 及 Gemini Enterprise Agent Platform 向开发者开放。
推荐理由:官方同步开放两款新模型的开发者接口,明确了各自的延迟、成本及能力边界,为构建图文视频混合工作流提供了具体选型依据。