跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

221条精选相关主题产品更新论文研究开源生态

最新精选

第 141–160 条 · 共 221 条
3月27日周四
3月25日周二
  1. OpenAI News65

    OpenAI 发布新模型

    OpenAI 官方宣布发布一款新模型。该更新标志着 OpenAI 在模型能力上的进一步演进,具体技术细节和基准表现需参考官方完整文档。

    推荐理由:OpenAI官方发布新模型,读者可据此了解其最新能力边界及在生成任务中的潜在应用价值。

3月20日周四
3月18日周二
  1. Hugging Face Blog77

    NVIDIA GTC 2025 发布 Cosmos Transfer、Physical AI Dataset 和 Isaac GR00T N1 等开源物理AI资源

    NVIDIA 在 GTC 2025 大会上发布了三项面向物理 AI 开发的开源成果:Cosmos Transfer 世界基础模型、Physical AI Dataset 数据集以及 NVIDIA Isaac GR00T N1 人形机器人推理模型。

    推荐理由:原文汇总了NVIDIA在GTC 2025发布的三款开源物理AI资源,涵盖世界模型、数据集及人形机器人基础模型,为开发者提供了具体的技术入口。

3月17日周一
  1. Mistral AI77

    Mistral AI 发布 Mistral Small 3.1 开源多模态模型

    Mistral AI 发布 Mistral Small 3.1,这是一款 Apache 2.0 许可的开源模型,支持 128k tokens 上下文窗口和多模态理解。该模型推理速度达 150 tokens/s,可在单张 RTX 4090 或 32GB RAM Mac 上运行,目前已上线 Hugging Face 和 La Plateforme API。

    推荐理由:官方公布小参数模型在文本、多模态及长上下文维度的性能数据与硬件适配细节,为端侧部署提供具体参考。

3月12日周三
  1. Hugging Face Blog92

    Google 发布 Gemma 3:支持多模态、140+语言及128k上下文的开源大模型

    Google 发布新一代开源多模态大模型 Gemma 3,包含 1B、4B、12B 和 27B 四种参数规模。除 1B 版本仅支持文本外,其余版本均支持图像输入,上下文窗口最高达 128k tokens,并支持 140 多种语言。

    推荐理由:原文详细列出了Gemma 3各尺寸参数、上下文长度及多语言支持,并提供了在Hugging Face生态中的具体部署与推理代码示例。

3月7日周五
  1. Mistral AI78

    Mistral 发布 Mistral OCR:支持多模态文档理解与结构化输出

    Mistral AI 推出 Mistral OCR,这是一款专为文档理解设计的 API,能够以高准确率解析文本、表格、公式及图像等元素。该模型在多项基准测试中表现优于 Gemini-1.5-Pro 和 GPT-4o,支持原生多语言处理,单节点每分钟可处理高达 2000 页文档。

    推荐理由:官方发布了针对文档理解的专用 OCR 模型,提供了详细的基准测试数据对比和 API 定价策略,适合需要处理复杂多模态文档的开发者评估。

3月4日周二
  1. Hugging Face Blog65

    Cohere For AI 发布 Aya Vision 8B/32B 开源多模态模型

    Cohere For AI 推出 Aya Vision 8B 和 32B 两款开源权重视觉语言模型(VLM),旨在解决多模态模型的多语言性能挑战。该系列基于 SigLIP2 视觉编码器和 Aya Expanse 语言模型,采用动态图像分块、Pixel Shuffle 降采样以及多模态模型合并等技术,支持 23 种语言的图像描述、视觉问答及 OCR 等任务。

    推荐理由:Cohere For AI 发布 Aya Vision 系列开源多模态模型,通过合成标注与模型合并技术提升23种语言下的视觉理解能力。

2月20日周四
  1. Hugging Face Blog78

    Hugging Face 发布 SmolVLM2 系列模型,支持全设备视频理解

    Hugging Face 发布 SmolVLM2 系列模型,包含 2.2B、500M 和 256M 三种参数规模,旨在让视频理解能力在所有设备上运行。SmolVLM2 2.2B 在 Video-MME 基准测试中表现优于现有 2B 级模型,而 500M 和 256M 版本则提供了极小的内存占用。

    推荐理由:原文给出了三种参数规模的视频理解模型及端侧部署方案,读者可以据此评估小模型在本地设备上的实际可用性。

2月19日周三
1月30日周四
  1. Mistral AI82

    Mistral AI 发布 Mistral Small 3:24B 参数 Apache 2.0 开源模型

    Mistral AI 发布 Mistral Small 3,这是一款基于 Apache 2.0 许可证的 24B 参数低延迟优化模型。该模型在 MMLU 上准确率超过 81%,推理速度达 150 tokens/s,比同硬件上的 Llama 3.3 70B 快 3 倍以上。

    推荐理由:原文给出了24B参数模型的Apache 2.0许可、3倍于竞品的推理速度及本地部署门槛,读者可据此评估其在低延迟场景下的替代价值。

1月23日周四
  1. Hugging Face Blog65

    Hugging Face 发布 SmolVLM-256M 与 SmolVLM-500M 超小型视觉语言模型

    Hugging Face 推出 SmolVLM-256M 和 SmolVLM-500M,其中 256M 版本号称是全球最小的视觉语言模型(VLM)。新模型采用更小的 SigLIP base patch-16/512 视觉编码器以支持更大图像分辨率,并优化了 tokenization 策略,在 transformers、MLX 和 ONNX 中可直接加载运行。

    推荐理由:官方发布了256M和500M参数的SmolVLM,展示了在极小参数量下保持多模态性能的技术权衡与优化路径。

1月15日周三
  1. Hugging Face Blog62

    Hugging Face 发布高速静态嵌入模型 static-retrieval-mrl-en-v1 和 static-similarity-mrl-multilingual-v1

    Hugging Face 发布两款新的静态嵌入模型 sentence-transformers/static-retrieval-mrl-en-v1(英语检索)和 sentence-transformers/static-similarity-mrl-multilingual-v1(多语言相似度)。

    推荐理由:官方发布了在CPU上比主流模型快100至400倍的静态嵌入模型,并公开了完整的训练策略与脚本,为端侧部署提供了高效方案。

1月13日周一
  1. Mistral AI65

    Mistral AI 发布 Codestral 25.01 编码模型

    Mistral AI 发布 Codestral 25.01,采用更高效架构和改进的 tokenizer,代码生成与补全速度约为原版的 2 倍。该模型在 FIM(fill-in-the-middle)用例中达到 SOTA,上下文长度扩展至 256k,并在 HumanEval 等基准测试中领先于同量级模型。

    推荐理由:原文给出了新模型的架构改进、速度提升及多语言基准数据,读者可据此评估其在代码补全场景下的实际性能优势。

1月10日周五
12月19日周四
12月18日周三
  1. Hugging Face Blog68

    IBM 等机构发布 Bamba-9B 混合 Mamba2 模型

    IBM、普林斯顿大学、卡内基梅隆大学和伊利诺伊大学香槟分校联合推出 Bamba-9B,这是一款完全使用开放数据训练的混合 Mamba2 模型。在 vLLM 框架下,该模型相比标准 Transformer 实现了 2.5 倍吞吐量提升和 2 倍延迟加速。目前模型已支持 transformers、vLLM、TRL 和 llama.cpp,并公开了包含有状态数据加载器在内的训练与微调配方。

    推荐理由:IBM 联合高校发布基于开放数据训练的混合 Mamba2 模型,提供显著推理效率提升及完整训练复现资源。

12月17日周二
  1. Hugging Face Blog70

    TII 发布 Falcon3 系列开源大语言模型

    Technology Innovation Institute (TII) 发布了 Falcon3 系列开源大语言模型,包含 1B、3B、7B、10B 以及 Mamba-7B 五个基础模型版本。

    推荐理由:原文详细列出了Falcon3系列各尺寸模型的基准测试得分及训练创新点,读者可据此评估其在小参数规模下的性能表现与开源许可适用性。