跳到正文

#模型发布

今日 0 条
12月20日周五
12月19日周四
12月18日周三
  1. Hugging Face Blog68

    IBM 等机构发布 Bamba-9B 混合 Mamba2 模型

    IBM、普林斯顿大学、卡内基梅隆大学和伊利诺伊大学香槟分校联合推出 Bamba-9B,这是一款完全使用开放数据训练的混合 Mamba2 模型。在 vLLM 框架下,该模型相比标准 Transformer 实现了 2.5 倍吞吐量提升和 2 倍延迟加速。目前模型已支持 transformers、vLLM、TRL 和 llama.cpp,并公开了包含有状态数据加载器在内的训练与微调配方。

    推荐理由:IBM 联合高校发布基于开放数据训练的混合 Mamba2 模型,提供显著推理效率提升及完整训练复现资源。

12月17日周二
  1. Hugging Face Blog70

    TII 发布 Falcon3 系列开源大语言模型

    Technology Innovation Institute (TII) 发布了 Falcon3 系列开源大语言模型,包含 1B、3B、7B、10B 以及 Mamba-7B 五个基础模型版本。

    推荐理由:原文详细列出了Falcon3系列各尺寸模型的基准测试得分及训练创新点,读者可据此评估其在小参数规模下的性能表现与开源许可适用性。

12月9日周一
  1. OpenAI News82

    OpenAI 发布 Sora 文本生成视频模型

    OpenAI 正式推出 Sora,这是一款能够根据文本提示词生成长达一分钟视频的 AI 模型。该模型能准确理解用户的指令并呈现复杂的场景、角色和多镜头叙事。Sora 目前向部分测试用户开放,旨在展示其在模拟物理世界方面的能力。

    推荐理由:官方直接宣布新模型上线,提供了最权威的能力定义和访问入口信息。

  2. OpenAI News20

    OpenAI Sora 系统卡

    OpenAI 发布视频生成模型 Sora 的系统卡。Sora 支持文本、图像及视频输入,能生成全新视频,其设计基于 DALL-E 和 GPT 模型的经验,旨在为用户提供扩展的故事讲述与创意表达工具。

12月5日周四
  1. Hugging Face Blog78

    Hugging Face 介绍 Google 发布的 PaliGemma 2 视觉语言模型

    Hugging Face 博客介绍了 Google 新发布的 PaliGemma 2 视觉语言模型,该模型结合了 SigLIP 图像编码器与 Gemma 2 语言模型,提供 3B、10B 和 28B 三种参数规模,并支持 224x224、448x448 和 896x896 多种输入分辨率。

    推荐理由:原文给出了PaliGemma 2的多尺寸变体、分辨率支持及量化性能数据,读者可据此评估其在不同算力条件下的微调潜力与部署成本。

11月26日周二
  1. Hugging Face Blog68

    Hugging Face 发布 SmolVLM 2B 视觉语言模型

    Hugging Face 发布 SmolVLM,这是一款参数量为 2B 的视觉语言模型,在 transformers 库中实现了最低的显存占用(约 5.02 GB)。

    推荐理由:SmolVLM 在保持视觉问答能力的同时将显存占用降至约 5GB,为端侧部署和低成本微调提供了具体的性能基准与开源训练配方。

11月18日周一
  1. Mistral AI80

    Mistral AI 发布 Pixtral Large 124B 多模态模型

    Mistral AI 发布 Pixtral Large,这是一个基于 Mistral Large 2 构建的 124B 参数开源权重多模态模型。该模型包含 123B 的多模态解码器和 1B 参数的视觉编码器,支持 128K 上下文窗口,能容纳至少 30 张高分辨率图像。

    推荐理由:原文给出了124B参数规模、128K上下文窗口及在MathVista等基准上的具体得分,读者可据此评估其图像理解能力与开源权重可用性。

10月24日周四
10月22日周二
10月16日周三
9月25日周三
  1. Hugging Face Blog92

    Hugging Face 联合 Meta 发布 Llama 3.2 多模态与小型模型

    Hugging Face 宣布上线 Llama 3.2 系列共10个开放权重模型,包含支持视觉理解的 11B 和 90B 多模态版本,以及适用于端侧运行的 1B 和 3B 文本模型。其中 3B Instruct 版本在 IFEval 指令遵循基准上表现优异,且所有模型均已完成 Transformers、TGI 等主流框架的集成适配。需注意欧盟地区用户无法获得多模态版本的商业使用授权。

    推荐理由:原文详细列出了Llama 3.2系列模型的参数规模、基准测试数据及在Hugging Face生态中的部署方法,为开发者评估其视觉理解与端侧运行能力提供了直接依据。

9月17日周二
  1. Mistral AI82

    Mistral AI 发布原生多模态模型 Pixtral 12B

    Mistral AI 发布原生多模态模型 Pixtral 12B,采用 Apache 2.0 许可证开源。该模型基于 Mistral Nemo 架构,支持 128k token 长上下文和可变图像尺寸,在 MMMU 基准测试中达到 52.5%,旨在作为 Mistral Nemo 12B 的直接替代品,兼顾多模态理解与文本指令遵循能力。

    推荐理由:官方发布了原生多模态模型 Pixtral 12B,在保持文本性能的同时提升了视觉推理能力,并提供了多种部署方式。

9月12日周四
8月12日周一
7月31日周三
7月24日周三
  1. Mistral AI75

    Mistral AI 发布 Mistral Large 2:1230 亿参数,支持 128k 上下文与多语言

    Mistral AI 正式发布新一代大模型 Mistral Large 2,拥有 1230 亿参数并支持 128k 上下文窗口。该模型针对单节点推理优化,在多语言处理、代码生成及逻辑推理方面性能显著提升,并在 MMLU 等基准测试中达到新的高度。

    推荐理由:官方公布 Mistral Large 2 的架构参数、多语言支持及在主流基准测试中的性能表现,为评估其成本效益和实际部署能力提供直接依据。

7月23日周二
  1. Hugging Face Blog95

    Hugging Face 上线 Llama 3.1 405B/70B/8B 模型及全栈集成指南

    Hugging Face 正式上架 Meta 发布的 Llama 3.1 系列模型,包含 8B、70B 和 405B 三种尺寸的基座与指令微调版本,以及 Llama Guard 3 和 Prompt Guard 安全模型。

    推荐理由:原文详细列出了 Llama 3.1 各尺寸模型的显存需求、量化方案及微调代码,为开发者评估部署成本和集成路径提供了具体参考。

7月18日周四
  1. Mistral AI82

    Mistral AI 发布与 NVIDIA 合作的 12B 参数模型 Mistral NeMo

    Mistral AI 发布 Mistral NeMo,这是一款与 NVIDIA 合作开发的 12B 参数模型,拥有高达 128k tokens 的上下文窗口。该模型在推理、世界知识和编码准确性方面在其尺寸类别中处于领先地位,并作为 Mistral 7B 的即插即用替代品提供预训练基座和指令微调检查点,采用 Apache 2.0 许可证。

    推荐理由:Mistral NeMo 作为 Mistral 7B 的即插即用替代方案,提供了 128k 上下文窗口和 Apache 2.0 许可,适合需要多语言支持和高效代码压缩的研究者与开发者。

7月16日周二
  1. Mistral AI62

    Mistral AI 发布 Codestral Mamba:基于 Mamba 架构的代码模型

    Mistral AI 发布了 Codestral Mamba,这是继 Mixtral 系列后探索新架构的又一成果。该模型由 Albert Gu 和 Tri Dao 协助设计,利用 Mamba 架构实现线性时间推理和无限长度序列建模的理论能力。

    推荐理由:Mistral AI 发布了基于 Mamba 架构的 Codestral Mamba,该模型在代码生成和推理能力上可与 SOTA Transformer 模型媲美,且支持线性时间推理。

6月27日周四
  1. Hugging Face Blog86

    Google 发布 Gemma 2 开源大语言模型

    Google 发布了最新一代开源大语言模型 Gemma 2,包含 9B 和 27B 两种参数规模的基座与指令微调版本。该模型引入了滑动窗口注意力、Logit 软封顶、知识蒸馏和模型合并等四项主要技术进步,上下文长度为 8K tokens。Hugging Face 已同步提供 Transformers 集成、Inference Endpoints 部署支持以及基于 TRL 的微调示例代码。

    推荐理由:原文详细解析了Gemma 2在滑动窗口注意力、软封顶及知识蒸馏上的技术改进,并提供了基于Transformers的微调与部署指南。

6月12日周三
  1. Hugging Face Blog82

    Hugging Face 集成 Stable Diffusion 3 Medium 模型

    Stable Diffusion 3 Medium(2B 参数)已上线 Hugging Face Hub 并支持通过 🧨 Diffusers 库使用。该模型采用多模态扩散 Transformer (MMDiT) 架构和 Rectified Flow Matching 训练目标,引入了新的 FlowMatchEulerDiscreteScheduler 调度器。

    推荐理由:官方给出了 SD3 Medium 的架构细节、显存优化方案及微调脚本,开发者可据此评估其在不同硬件上的部署可行性。

6月8日周六
5月29日周三
  1. Mistral AI83

    Mistral AI 发布首个代码生成模型 Codestral

    Mistral AI 推出其首个专为代码生成设计的开放权重模型 Codestral。该模型参数量为 22B,支持 80 多种编程语言,拥有 32k 上下文窗口,并在 RepoBench 等长程代码生成评测中表现优于竞品。

    推荐理由:官方详细披露了 Codestral 的架构参数、多语言支持及基准测试数据,并明确了非生产许可与商业授权路径,为开发者评估其实际编码能力提供了完整依据。

5月24日周五
  1. Hugging Face Blog68

    TII 发布 Falcon 2 11B LLM 和 VLM 模型

    TII 发布 Falcon 2 系列新模型,包含 11B 参数的基础大语言模型(LLM)和支持图像理解的视觉语言模型(VLM)。

    推荐理由:原文给出了11B参数模型的训练数据规模、架构细节及在英语和多语言基准上的具体评测分数,读者可据此评估其性能与开源可用性。

5月14日周二
  1. Hugging Face Blog82

    谷歌发布开源视觉语言模型 PaliGemma

    谷歌推出开源视觉语言模型家族 PaliGemma,采用 SigLIP-So400m 作为图像编码器、Gemma-2B 作为文本解码器。该模型支持图像与文本输入并输出文本,提供预训练(PT)、混合任务微调(Mix)及特定基准微调(FT)三类检查点,涵盖 224x224、448x448、896x896 三种分辨率及多种精度格式。

    推荐理由:原文详细拆解了PaliGemma的架构组成与推理流程,并提供了基于Transformers的微调代码示例,适合开发者快速上手该开源视觉语言模型。

5月13日周一
  1. OpenAI News84

    OpenAI 发布 GPT-4o 旗舰多模态模型

    OpenAI 正式发布 GPT-4o(GPT-4 Omni),这是一款能够同时处理文本、音频和图像输入并生成相应输出的新旗舰模型。该模型旨在实现更自然的人机交互体验,支持实时语音对话及高级视觉分析功能。

    推荐理由:OpenAI 官方宣布 GPT-4o 发布,强调其作为旗舰模型在音频、视觉和文本处理上的原生多模态能力。

  2. OpenAI News80

    OpenAI 发布新模型

    OpenAI 官方宣布发布新模型。具体型号及能力细节未在标题中明确展示。

    推荐理由:OpenAI 官方宣布新模型发布,提供了最权威的一手信息源。

4月29日周一
  1. Hugging Face Blog61

    Hugging Face 发布 StarCoder2-15B-Instruct-v0.1:首个全透明自对齐代码大模型

    Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个采用完全宽松且透明管道训练的自对齐代码 LLM。该模型利用 StarCoder2-15B 自身生成指令和响应进行微调,在 HumanEval 上取得 72.6 分,超越了 CodeLlama-70B-Instruct。

    推荐理由:展示了完全自对齐的代码模型训练流程,提供了无需蒸馏专有模型即可达到高性能的开源方案。

4月22日周一
4月18日周四
  1. Hugging Face Blog92

    Meta 发布 Llama 3 开源大语言模型

    Meta 正式发布 Llama 3 系列开源大语言模型,包含 8B 和 70B 两种参数规模,均提供基础版和指令微调版。该模型采用新 tokenizer 将词汇表扩展至 128,256,并在超过 15 万亿 tokens 的数据上进行了预训练。

    推荐理由:原文详细列出了 Llama 3 的模型规格、训练数据量及在 Hugging Face 生态中的集成方式,为开发者提供了从本地部署到云端推理的具体技术路径。