跳到正文

#模型发布

今日 0 条
6月26日周四
  1. Hugging Face Blog84

    Gemma 3n正式登陆开源生态,支持transformers、MLX等主流框架

    Gemma 3n现已全面支持transformers、timm、MLX、llama.cpp、Ollama等主流开源库,实现本地化多模态运行。该模型包含E2B和E4B两种规格,通过Per-Layer Embeddings技术将实际5B/8B参数的显存占用降至2GB/3GB,并首次引入MobileNet-v5视觉编码器与USM音频编码器。

    推荐理由:原文详细列出了Gemma 3n在主流开源库中的集成方式及显存优化原理,为开发者提供了从推理到微调的完整落地路径。

6月10日周二
  1. Mistral AI80

    Mistral AI 发布首个推理模型 Magistral

    Mistral AI 发布其首个推理模型 Magistral,分为开源的 Magistral Small(24B 参数)和企业版 Magistral Medium。

    推荐理由:原文给出了双版本参数规模、AIME2024 具体得分及多语言原生推理特性,读者可据此评估其在专业领域与合规场景下的实际能力边界。

6月3日周二
  1. Hugging Face Blog65

    H Company 发布 Holo1 GUI 自动化 VLM 家族及 Surfer-H 智能体

    H Company 在 Hugging Face Hub 上发布了 Holo1 系列动作视觉语言模型(Action VLMs)和 WebClick 基准测试。该系列包含 Holo1-3B 和 Holo1-7B 两个版本,基于 Qwen2.5-VL 架构,其中 Holo1-7B 在通用 UI 定位基准上达到 76.2% 的平均准确率。

    推荐理由:原文发布了专为GUI自动化设计的开源视觉语言模型家族及基准,提供了低成本实现网页任务自动化的具体性能数据。

  2. Hugging Face Blog65

    Hugging Face 发布 SmolVLA:基于社区数据训练的高效开源视觉语言动作模型

    Hugging Face 推出 SmolVLA-450M,这是一款紧凑的开源视觉语言动作(VLA)模型,专为机器人设计且可在消费级硬件上运行。该模型仅使用 LeRobot 社区共享的数据集进行预训练,在 LIBERO、Meta-World 模拟环境及 SO100/SO101 真实任务中表现优于 ACT 等更强基线。

    推荐理由:原文展示了仅用社区数据训练的紧凑视觉语言动作模型,在消费级硬件上实现高效推理并超越更大基线,为机器人研究提供了可复现的低门槛方案。

5月28日周三
  1. Mistral AI65

    Mistral AI 发布首个代码专用嵌入模型 Codestral Embed

    Mistral AI 发布其首个专为代码设计的嵌入模型 Codestral Embed,旨在优化真实世界代码数据的检索性能。该模型在多项基准测试中表现优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型,支持不同维度和精度的输出以平衡检索质量与存储成本。

    推荐理由:Mistral 推出首个代码专用嵌入模型,在 SWE-Bench 等真实代码检索基准上超越竞品,并提供灵活的维度与精度权衡方案。

5月21日周三
  1. Mistral AI80

    Mistral 发布 Devstral:面向软件工程任务的开源智能体大模型

    Mistral AI 联合 All Hands AI 推出 Devstral,这是一款专为解决真实 GitHub 问题设计的智能体大模型。Devstral 在 SWE-Bench Verified 基准测试中取得 46.8% 的成绩,比此前开源最佳模型高出 6% 以上,并超越了 Deepseek-V3-0324 和 Qwen3 232B-A22B 等更大参数量的模型。

    推荐理由:该模型在SWE-Bench Verified上大幅超越现有开源基准,且支持单卡本地部署,为隐私敏感场景提供了高性价比的编码智能体方案。

  2. Hugging Face Blog45

    Falcon-Arabic:阿拉伯语大模型新基准

    Hugging Face 推出基于 Falcon 3 架构的 7B 参数多语言模型 Falcon-Arabic,支持阿拉伯语、英语等语言及 32,000 tokens 上下文窗口。该模型在 OALL v2 基准测试中显著超越同尺寸及 4 倍规模的现有阿拉伯语 LLM,通过扩展 32,000 个阿拉伯语专用 token 和优化嵌入策略实现高性能。

5月15日周四
  1. Hugging Face Blog48

    Hugging Face 发布 Falcon-Edge:基于 BitNet 架构的 1.58bit 可微调语言模型系列

    Hugging Face 推出 Falcon-Edge 系列,这是基于 BitNet 架构的 1.58bit 三元权重语言模型。该系列提供 1B 和 3B 参数版本,包含基础与指令微调模型,并支持 bfloat16、原生 BitNet 及预量化变体以方便微调。Falcon-Edge 在同等规模模型中表现优异,旨在实现边缘设备上的高效部署。

5月7日周三
  1. Mistral AI75

    Mistral AI 发布 Mistral Medium 3 模型

    Mistral AI 正式发布 Mistral Medium 3,这是一款旨在平衡 SOTA 性能、更低成本和简化部署的新类别模型。该模型在编码和多模态理解等专业用例中表现领先,基准测试显示其性能达到或超过 Claude Sonnet 3.7 的 90%,但 API 价格低至每百万 token 输入 $0.4 / 输出 $2。

    推荐理由:Mistral Medium 3 以显著低于竞品的成本提供接近前沿的性能,并支持混合或本地部署,为企业级应用提供了兼顾效率与可控性的新选择。

4月29日周二
  1. Hugging Face Blog68

    Meta 发布 Llama Guard 4 及 Llama Prompt Guard 2 模型

    Meta 发布 Llama Guard 4,这是一个从 Llama 4 Scout 剪枝而来的 12B 稠密多模态安全模型,支持检测图像和文本中的不安全内容。同时推出两个轻量级 Llama Prompt Guard 2 模型(86M 和 22M 参数),专门用于检测提示词注入和越狱攻击。

    推荐理由:原文详细说明了 Llama Guard 4 的架构剪枝来源、多语言分类能力及与上一代在单图和多图场景下的性能对比数据。

4月26日周六
  1. Hugging Face Blog68

    ServiceNow 开源 PipelineRL:支持飞行中权重更新的 LLM 强化学习实现

    ServiceNow Research 在 Hugging Face 博客宣布开源实验性强化学习实现 PipelineRL,旨在解决大规模 LLM RL 训练中推理吞吐量与在线数据收集之间的权衡问题。

    推荐理由:原文开源了通过飞行中权重更新解决 RL 训练吞吐与数据新鲜度权衡的实现,并展示了在简化算法下达到竞争性基准结果的技术细节。

4月11日周五
  1. Hugging Face Blog28

    Visual Salamandra 发布:基于 7B 参数模型的多模态理解能力扩展

    Language Technologies Lab 发布 Visual Salamandra,将 Salamandra LLM 扩展至图像与视频多模态任务。该模型基于 70 亿参数基础架构,集成 Google SigLIP 编码器与 MLP 投影器,支持 VQA、OCR 及数学推理等应用。其训练涵盖 610 万指令微调实例,重点强化欧洲语言多样性与多模态对齐能力。

4月5日周六
3月27日周四
3月18日周二
  1. Hugging Face Blog77

    NVIDIA GTC 2025 发布 Cosmos Transfer、Physical AI Dataset 和 Isaac GR00T N1 等开源物理AI资源

    NVIDIA 在 GTC 2025 大会上发布了三项面向物理 AI 开发的开源成果:Cosmos Transfer 世界基础模型、Physical AI Dataset 数据集以及 NVIDIA Isaac GR00T N1 人形机器人推理模型。

    推荐理由:原文汇总了NVIDIA在GTC 2025发布的三款开源物理AI资源,涵盖世界模型、数据集及人形机器人基础模型,为开发者提供了具体的技术入口。

3月17日周一
  1. Mistral AI77

    Mistral AI 发布 Mistral Small 3.1 开源多模态模型

    Mistral AI 发布 Mistral Small 3.1,这是一款 Apache 2.0 许可的开源模型,支持 128k tokens 上下文窗口和多模态理解。该模型推理速度达 150 tokens/s,可在单张 RTX 4090 或 32GB RAM Mac 上运行,目前已上线 Hugging Face 和 La Plateforme API。

    推荐理由:官方公布小参数模型在文本、多模态及长上下文维度的性能数据与硬件适配细节,为端侧部署提供具体参考。

3月12日周三
  1. Hugging Face Blog92

    Google 发布 Gemma 3:支持多模态、140+语言及128k上下文的开源大模型

    Google 发布新一代开源多模态大模型 Gemma 3,包含 1B、4B、12B 和 27B 四种参数规模。除 1B 版本仅支持文本外,其余版本均支持图像输入,上下文窗口最高达 128k tokens,并支持 140 多种语言。

    推荐理由:原文详细列出了Gemma 3各尺寸参数、上下文长度及多语言支持,并提供了在Hugging Face生态中的具体部署与推理代码示例。

3月7日周五
  1. Mistral AI78

    Mistral 发布 Mistral OCR:支持多模态文档理解与结构化输出

    Mistral AI 推出 Mistral OCR,这是一款专为文档理解设计的 API,能够以高准确率解析文本、表格、公式及图像等元素。该模型在多项基准测试中表现优于 Gemini-1.5-Pro 和 GPT-4o,支持原生多语言处理,单节点每分钟可处理高达 2000 页文档。

    推荐理由:官方发布了针对文档理解的专用 OCR 模型,提供了详细的基准测试数据对比和 API 定价策略,适合需要处理复杂多模态文档的开发者评估。

3月4日周二
  1. Hugging Face Blog65

    Cohere For AI 发布 Aya Vision 8B/32B 开源多模态模型

    Cohere For AI 推出 Aya Vision 8B 和 32B 两款开源权重视觉语言模型(VLM),旨在解决多模态模型的多语言性能挑战。该系列基于 SigLIP2 视觉编码器和 Aya Expanse 语言模型,采用动态图像分块、Pixel Shuffle 降采样以及多模态模型合并等技术,支持 23 种语言的图像描述、视觉问答及 OCR 等任务。

    推荐理由:Cohere For AI 发布 Aya Vision 系列开源多模态模型,通过合成标注与模型合并技术提升23种语言下的视觉理解能力。

2月21日周五
2月20日周四
  1. Hugging Face Blog78

    Hugging Face 发布 SmolVLM2 系列模型,支持全设备视频理解

    Hugging Face 发布 SmolVLM2 系列模型,包含 2.2B、500M 和 256M 三种参数规模,旨在让视频理解能力在所有设备上运行。SmolVLM2 2.2B 在 Video-MME 基准测试中表现优于现有 2B 级模型,而 500M 和 256M 版本则提供了极小的内存占用。

    推荐理由:原文给出了三种参数规模的视频理解模型及端侧部署方案,读者可以据此评估小模型在本地设备上的实际可用性。

2月19日周三
2月17日周一
  1. Mistral AI45

    Mistral Saba 发布:面向中东与南亚的 24B 区域语言模型

    Mistral AI 推出首个区域专用模型 Mistral Saba,这是一款拥有 24B 参数的模型,专为中东和南亚地区训练。该模型支持阿拉伯语及多种印度起源语言,在响应速度超过 150 tokens/s 的同时,准确率优于体积大其 5 倍的通用模型。Mistral Saba 提供 API 服务并支持本地部署,可运行于单 GPU 系统,适用于对话支持、领域专家系统及文化内容创作等场景。

1月30日周四
  1. Mistral AI82

    Mistral AI 发布 Mistral Small 3:24B 参数 Apache 2.0 开源模型

    Mistral AI 发布 Mistral Small 3,这是一款基于 Apache 2.0 许可证的 24B 参数低延迟优化模型。该模型在 MMLU 上准确率超过 81%,推理速度达 150 tokens/s,比同硬件上的 Llama 3.3 70B 快 3 倍以上。

    推荐理由:原文给出了24B参数模型的Apache 2.0许可、3倍于竞品的推理速度及本地部署门槛,读者可据此评估其在低延迟场景下的替代价值。

1月23日周四
  1. Hugging Face Blog65

    Hugging Face 发布 SmolVLM-256M 与 SmolVLM-500M 超小型视觉语言模型

    Hugging Face 推出 SmolVLM-256M 和 SmolVLM-500M,其中 256M 版本号称是全球最小的视觉语言模型(VLM)。新模型采用更小的 SigLIP base patch-16/512 视觉编码器以支持更大图像分辨率,并优化了 tokenization 策略,在 transformers、MLX 和 ONNX 中可直接加载运行。

    推荐理由:官方发布了256M和500M参数的SmolVLM,展示了在极小参数量下保持多模态性能的技术权衡与优化路径。

1月15日周三
  1. Hugging Face Blog62

    Hugging Face 发布高速静态嵌入模型 static-retrieval-mrl-en-v1 和 static-similarity-mrl-multilingual-v1

    Hugging Face 发布两款新的静态嵌入模型 sentence-transformers/static-retrieval-mrl-en-v1(英语检索)和 sentence-transformers/static-similarity-mrl-multilingual-v1(多语言相似度)。

    推荐理由:官方发布了在CPU上比主流模型快100至400倍的静态嵌入模型,并公开了完整的训练策略与脚本,为端侧部署提供了高效方案。

1月13日周一
  1. Mistral AI65

    Mistral AI 发布 Codestral 25.01 编码模型

    Mistral AI 发布 Codestral 25.01,采用更高效架构和改进的 tokenizer,代码生成与补全速度约为原版的 2 倍。该模型在 FIM(fill-in-the-middle)用例中达到 SOTA,上下文长度扩展至 256k,并在 HumanEval 等基准测试中领先于同量级模型。

    推荐理由:原文给出了新模型的架构改进、速度提升及多语言基准数据,读者可据此评估其在代码补全场景下的实际性能优势。

1月10日周五
12月19日周四
12月18日周三
  1. Hugging Face Blog68

    IBM 等机构发布 Bamba-9B 混合 Mamba2 模型

    IBM、普林斯顿大学、卡内基梅隆大学和伊利诺伊大学香槟分校联合推出 Bamba-9B,这是一款完全使用开放数据训练的混合 Mamba2 模型。在 vLLM 框架下,该模型相比标准 Transformer 实现了 2.5 倍吞吐量提升和 2 倍延迟加速。目前模型已支持 transformers、vLLM、TRL 和 llama.cpp,并公开了包含有状态数据加载器在内的训练与微调配方。

    推荐理由:IBM 联合高校发布基于开放数据训练的混合 Mamba2 模型,提供显著推理效率提升及完整训练复现资源。

12月17日周二
  1. Hugging Face Blog70

    TII 发布 Falcon3 系列开源大语言模型

    Technology Innovation Institute (TII) 发布了 Falcon3 系列开源大语言模型,包含 1B、3B、7B、10B 以及 Mamba-7B 五个基础模型版本。

    推荐理由:原文详细列出了Falcon3系列各尺寸模型的基准测试得分及训练创新点,读者可据此评估其在小参数规模下的性能表现与开源许可适用性。

12月5日周四
  1. Hugging Face Blog78

    Hugging Face 介绍 Google 发布的 PaliGemma 2 视觉语言模型

    Hugging Face 博客介绍了 Google 新发布的 PaliGemma 2 视觉语言模型,该模型结合了 SigLIP 图像编码器与 Gemma 2 语言模型,提供 3B、10B 和 28B 三种参数规模,并支持 224x224、448x448 和 896x896 多种输入分辨率。

    推荐理由:原文给出了PaliGemma 2的多尺寸变体、分辨率支持及量化性能数据,读者可据此评估其在不同算力条件下的微调潜力与部署成本。

11月26日周二
  1. Hugging Face Blog68

    Hugging Face 发布 SmolVLM 2B 视觉语言模型

    Hugging Face 发布 SmolVLM,这是一款参数量为 2B 的视觉语言模型,在 transformers 库中实现了最低的显存占用(约 5.02 GB)。

    推荐理由:SmolVLM 在保持视觉问答能力的同时将显存占用降至约 5GB,为端侧部署和低成本微调提供了具体的性能基准与开源训练配方。

11月18日周一
  1. Mistral AI80

    Mistral AI 发布 Pixtral Large 124B 多模态模型

    Mistral AI 发布 Pixtral Large,这是一个基于 Mistral Large 2 构建的 124B 参数开源权重多模态模型。该模型包含 123B 的多模态解码器和 1B 参数的视觉编码器,支持 128K 上下文窗口,能容纳至少 30 张高分辨率图像。

    推荐理由:原文给出了124B参数规模、128K上下文窗口及在MathVista等基准上的具体得分,读者可据此评估其图像理解能力与开源权重可用性。

10月16日周三
9月25日周三
  1. Hugging Face Blog92

    Hugging Face 联合 Meta 发布 Llama 3.2 多模态与小型模型

    Hugging Face 宣布上线 Llama 3.2 系列共10个开放权重模型,包含支持视觉理解的 11B 和 90B 多模态版本,以及适用于端侧运行的 1B 和 3B 文本模型。其中 3B Instruct 版本在 IFEval 指令遵循基准上表现优异,且所有模型均已完成 Transformers、TGI 等主流框架的集成适配。需注意欧盟地区用户无法获得多模态版本的商业使用授权。

    推荐理由:原文详细列出了Llama 3.2系列模型的参数规模、基准测试数据及在Hugging Face生态中的部署方法,为开发者评估其视觉理解与端侧运行能力提供了直接依据。

9月17日周二
  1. Mistral AI82

    Mistral AI 发布原生多模态模型 Pixtral 12B

    Mistral AI 发布原生多模态模型 Pixtral 12B,采用 Apache 2.0 许可证开源。该模型基于 Mistral Nemo 架构,支持 128k token 长上下文和可变图像尺寸,在 MMMU 基准测试中达到 52.5%,旨在作为 Mistral Nemo 12B 的直接替代品,兼顾多模态理解与文本指令遵循能力。

    推荐理由:官方发布了原生多模态模型 Pixtral 12B,在保持文本性能的同时提升了视觉推理能力,并提供了多种部署方式。

8月12日周一
7月31日周三