跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

125条精选相关主题图像生成AI 视频语音与音频

最新精选

第 101–120 条 · 共 125 条
2月19日周三
2月7日周五
  1. Mistral AI73

    Mistral AI 发布全新 le Chat 助手并推出 Pro/Team/Enterprise 服务层级

    Mistral AI 正式发布全新 le Chat AI 助手,支持 iOS 和 Android 平台,并引入 Pro、Team 及企业级私有预览服务。该助手具备高达 ~1000 words / sec 的 Flash Answers 快速响应能力、基于 Black Forest Labs Flux Ultra 的图像生成以及 Code interpreter 代码执行功能。

    推荐理由:原文详细列出了 Flash Answers、Code interpreter 及 Enterprise 私有预览等具体功能变化,读者可据此评估其作为通用助手与生产力工具的实际能力边界。

1月24日周五
  1. Hugging Face Blog68

    Hugging Face smolagents 新增对视觉语言模型的支持

    Hugging Face 宣布其开源智能体框架 smolagents 现已原生支持视觉语言模型(VLM)。该更新允许在智能体启动时直接传入图像列表,或通过回调函数在每一步执行后动态将截图等视觉数据注入内存。

    推荐理由:smolagents 原生支持视觉语言模型,通过回调机制动态注入图像,使智能体能自主浏览网页并处理视觉信息。

1月23日周四
  1. Hugging Face Blog65

    Hugging Face 发布 SmolVLM-256M 与 SmolVLM-500M 超小型视觉语言模型

    Hugging Face 推出 SmolVLM-256M 和 SmolVLM-500M,其中 256M 版本号称是全球最小的视觉语言模型(VLM)。新模型采用更小的 SigLIP base patch-16/512 视觉编码器以支持更大图像分辨率,并优化了 tokenization 策略,在 transformers、MLX 和 ONNX 中可直接加载运行。

    推荐理由:官方发布了256M和500M参数的SmolVLM,展示了在极小参数量下保持多模态性能的技术权衡与优化路径。

1月10日周五
12月20日周五
  1. Hugging Face Blog62

    Artificial Analysis 发布 Big Bench Audio 数据集以评估音频推理能力

    Artificial Analysis 发布 Big Bench Audio 数据集,用于评估音频语言模型的推理能力。该数据集改编自 Big Bench Hard,包含 1000 个音频问题,涵盖逻辑演绎、导航和计数等类别。

    推荐理由:原文通过对比不同音频处理模式,量化了原生语音模型在复杂推理任务上的性能落差,为评估语音智能体能力提供了具体基准数据。

12月5日周四
  1. Hugging Face Blog78

    Hugging Face 介绍 Google 发布的 PaliGemma 2 视觉语言模型

    Hugging Face 博客介绍了 Google 新发布的 PaliGemma 2 视觉语言模型,该模型结合了 SigLIP 图像编码器与 Gemma 2 语言模型,提供 3B、10B 和 28B 三种参数规模,并支持 224x224、448x448 和 896x896 多种输入分辨率。

    推荐理由:原文给出了PaliGemma 2的多尺寸变体、分辨率支持及量化性能数据,读者可据此评估其在不同算力条件下的微调潜力与部署成本。

11月26日周二
  1. Hugging Face Blog68

    Hugging Face 发布 SmolVLM 2B 视觉语言模型

    Hugging Face 发布 SmolVLM,这是一款参数量为 2B 的视觉语言模型,在 transformers 库中实现了最低的显存占用(约 5.02 GB)。

    推荐理由:SmolVLM 在保持视觉问答能力的同时将显存占用降至约 5GB,为端侧部署和低成本微调提供了具体的性能基准与开源训练配方。

11月18日周一
  1. Mistral AI65

    Mistral AI 发布 le Chat 重大更新,集成 Canvas、联网搜索与图像生成

    Mistral AI 宣布为其免费生成式 AI 助手 le Chat 推出多项 Beta 新功能,包括带引用的联网搜索、用于创意构思和行内编辑的 Canvas 界面、基于 Pixtral Large 的文档与图像理解能力,以及由 Black Forest Labs Flux Pro 驱动的图像生成功能。

    推荐理由:Mistral 为 le Chat 集中上线了联网搜索、Canvas 画布及多模态理解等 Beta 功能,展示了其从模型层向应用层整合的完整工作流方案。

  2. Mistral AI80

    Mistral AI 发布 Pixtral Large 124B 多模态模型

    Mistral AI 发布 Pixtral Large,这是一个基于 Mistral Large 2 构建的 124B 参数开源权重多模态模型。该模型包含 123B 的多模态解码器和 1B 参数的视觉编码器,支持 128K 上下文窗口,能容纳至少 30 张高分辨率图像。

    推荐理由:原文给出了124B参数规模、128K上下文窗口及在MathVista等基准上的具体得分,读者可据此评估其图像理解能力与开源权重可用性。

10月24日周四
10月1日周二
  1. OpenAI News72

    OpenAI 发布 GPT-4o 实时 API 及视觉功能更新

    OpenAI 推出 GPT-4o 实时 API,支持低延迟语音对话,并增强视觉输入处理能力。该更新允许开发者构建具备即时交互能力的多模态应用,优化了音频和图像的端到端处理流程。

    推荐理由:官方发布新能力,开发者可据此评估其在图像理解与生成工作流中的集成价值。

9月25日周三
  1. Hugging Face Blog92

    Hugging Face 联合 Meta 发布 Llama 3.2 多模态与小型模型

    Hugging Face 宣布上线 Llama 3.2 系列共10个开放权重模型,包含支持视觉理解的 11B 和 90B 多模态版本,以及适用于端侧运行的 1B 和 3B 文本模型。其中 3B Instruct 版本在 IFEval 指令遵循基准上表现优异,且所有模型均已完成 Transformers、TGI 等主流框架的集成适配。需注意欧盟地区用户无法获得多模态版本的商业使用授权。

    推荐理由:原文详细列出了Llama 3.2系列模型的参数规模、基准测试数据及在Hugging Face生态中的部署方法,为开发者评估其视觉理解与端侧运行能力提供了直接依据。

9月17日周二
  1. Mistral AI82

    Mistral AI 发布原生多模态模型 Pixtral 12B

    Mistral AI 发布原生多模态模型 Pixtral 12B,采用 Apache 2.0 许可证开源。该模型基于 Mistral Nemo 架构,支持 128k token 长上下文和可变图像尺寸,在 MMMU 基准测试中达到 52.5%,旨在作为 Mistral Nemo 12B 的直接替代品,兼顾多模态理解与文本指令遵循能力。

    推荐理由:官方发布了原生多模态模型 Pixtral 12B,在保持文本性能的同时提升了视觉推理能力,并提供了多种部署方式。

9月16日周一
  1. Hugging Face Blog63

    HuggingChat 推出 Community Tools 功能

    HuggingFace 在 HuggingChat 中发布 Community Tools 功能,允许用户将任何公开的 HuggingFace Space 转化为模型可直接调用的工具。

    推荐理由:官方展示了将任意 Space 转为工具的流程,并提供了 RAG 模板,读者可据此扩展聊天助手的多模态能力。

7月24日周三
  1. Mistral AI75

    Mistral AI 发布 Mistral Large 2:1230 亿参数,支持 128k 上下文与多语言

    Mistral AI 正式发布新一代大模型 Mistral Large 2,拥有 1230 亿参数并支持 128k 上下文窗口。该模型针对单节点推理优化,在多语言处理、代码生成及逻辑推理方面性能显著提升,并在 MMLU 等基准测试中达到新的高度。

    推荐理由:官方公布 Mistral Large 2 的架构参数、多语言支持及在主流基准测试中的性能表现,为评估其成本效益和实际部署能力提供直接依据。

5月24日周五
  1. Hugging Face Blog68

    TII 发布 Falcon 2 11B LLM 和 VLM 模型

    TII 发布 Falcon 2 系列新模型,包含 11B 参数的基础大语言模型(LLM)和支持图像理解的视觉语言模型(VLM)。

    推荐理由:原文给出了11B参数模型的训练数据规模、架构细节及在英语和多语言基准上的具体评测分数,读者可据此评估其性能与开源可用性。

5月14日周二
  1. Hugging Face Blog82

    谷歌发布开源视觉语言模型 PaliGemma

    谷歌推出开源视觉语言模型家族 PaliGemma,采用 SigLIP-So400m 作为图像编码器、Gemma-2B 作为文本解码器。该模型支持图像与文本输入并输出文本,提供预训练(PT)、混合任务微调(Mix)及特定基准微调(FT)三类检查点,涵盖 224x224、448x448、896x896 三种分辨率及多种精度格式。

    推荐理由:原文详细拆解了PaliGemma的架构组成与推理流程,并提供了基于Transformers的微调代码示例,适合开发者快速上手该开源视觉语言模型。

5月13日周一
  1. OpenAI News84

    OpenAI 发布 GPT-4o 旗舰多模态模型

    OpenAI 正式发布 GPT-4o(GPT-4 Omni),这是一款能够同时处理文本、音频和图像输入并生成相应输出的新旗舰模型。该模型旨在实现更自然的人机交互体验,支持实时语音对话及高级视觉分析功能。

    推荐理由:OpenAI 官方宣布 GPT-4o 发布,强调其作为旗舰模型在音频、视觉和文本处理上的原生多模态能力。

4月15日周一
  1. Hugging Face Blog70

    Hugging Face 发布 Idefics2:8B 参数开源视觉语言模型

    Hugging Face 正式发布 Idefics2,这是一个拥有8B参数的通用多模态模型,支持文本与图像混合输入及生成。该模型采用 Apache 2.0 许可证开源,显著增强了 OCR 能力,并在 Visual Question Answering 等基准测试中表现优于同尺寸模型,甚至可与 LLava-Next-34B 等更大模型竞争。

    推荐理由:Idefics2 以8B参数和Apache 2.0协议开源,在视觉问答基准上表现优异并简化了微调流程,为社区提供了强大的多模态基础。