跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

221条精选相关主题产品更新论文研究开源生态

最新精选

第 161–180 条 · 共 221 条
12月9日周一
  1. OpenAI News82

    OpenAI 发布 Sora 文本生成视频模型

    OpenAI 正式推出 Sora,这是一款能够根据文本提示词生成长达一分钟视频的 AI 模型。该模型能准确理解用户的指令并呈现复杂的场景、角色和多镜头叙事。Sora 目前向部分测试用户开放,旨在展示其在模拟物理世界方面的能力。

    推荐理由:官方直接宣布新模型上线,提供了最权威的能力定义和访问入口信息。

12月5日周四
  1. Hugging Face Blog78

    Hugging Face 介绍 Google 发布的 PaliGemma 2 视觉语言模型

    Hugging Face 博客介绍了 Google 新发布的 PaliGemma 2 视觉语言模型,该模型结合了 SigLIP 图像编码器与 Gemma 2 语言模型,提供 3B、10B 和 28B 三种参数规模,并支持 224x224、448x448 和 896x896 多种输入分辨率。

    推荐理由:原文给出了PaliGemma 2的多尺寸变体、分辨率支持及量化性能数据,读者可据此评估其在不同算力条件下的微调潜力与部署成本。

11月26日周二
  1. Hugging Face Blog68

    Hugging Face 发布 SmolVLM 2B 视觉语言模型

    Hugging Face 发布 SmolVLM,这是一款参数量为 2B 的视觉语言模型,在 transformers 库中实现了最低的显存占用(约 5.02 GB)。

    推荐理由:SmolVLM 在保持视觉问答能力的同时将显存占用降至约 5GB,为端侧部署和低成本微调提供了具体的性能基准与开源训练配方。

11月18日周一
  1. Mistral AI80

    Mistral AI 发布 Pixtral Large 124B 多模态模型

    Mistral AI 发布 Pixtral Large,这是一个基于 Mistral Large 2 构建的 124B 参数开源权重多模态模型。该模型包含 123B 的多模态解码器和 1B 参数的视觉编码器,支持 128K 上下文窗口,能容纳至少 30 张高分辨率图像。

    推荐理由:原文给出了124B参数规模、128K上下文窗口及在MathVista等基准上的具体得分,读者可据此评估其图像理解能力与开源权重可用性。

10月24日周四
10月22日周二
10月16日周三
9月25日周三
  1. Hugging Face Blog92

    Hugging Face 联合 Meta 发布 Llama 3.2 多模态与小型模型

    Hugging Face 宣布上线 Llama 3.2 系列共10个开放权重模型,包含支持视觉理解的 11B 和 90B 多模态版本,以及适用于端侧运行的 1B 和 3B 文本模型。其中 3B Instruct 版本在 IFEval 指令遵循基准上表现优异,且所有模型均已完成 Transformers、TGI 等主流框架的集成适配。需注意欧盟地区用户无法获得多模态版本的商业使用授权。

    推荐理由:原文详细列出了Llama 3.2系列模型的参数规模、基准测试数据及在Hugging Face生态中的部署方法,为开发者评估其视觉理解与端侧运行能力提供了直接依据。

9月17日周二
  1. Mistral AI82

    Mistral AI 发布原生多模态模型 Pixtral 12B

    Mistral AI 发布原生多模态模型 Pixtral 12B,采用 Apache 2.0 许可证开源。该模型基于 Mistral Nemo 架构,支持 128k token 长上下文和可变图像尺寸,在 MMMU 基准测试中达到 52.5%,旨在作为 Mistral Nemo 12B 的直接替代品,兼顾多模态理解与文本指令遵循能力。

    推荐理由:官方发布了原生多模态模型 Pixtral 12B,在保持文本性能的同时提升了视觉推理能力,并提供了多种部署方式。

9月12日周四
8月12日周一
7月31日周三
7月24日周三
  1. Mistral AI75

    Mistral AI 发布 Mistral Large 2:1230 亿参数,支持 128k 上下文与多语言

    Mistral AI 正式发布新一代大模型 Mistral Large 2,拥有 1230 亿参数并支持 128k 上下文窗口。该模型针对单节点推理优化,在多语言处理、代码生成及逻辑推理方面性能显著提升,并在 MMLU 等基准测试中达到新的高度。

    推荐理由:官方公布 Mistral Large 2 的架构参数、多语言支持及在主流基准测试中的性能表现,为评估其成本效益和实际部署能力提供直接依据。

7月23日周二
  1. Hugging Face Blog95

    Hugging Face 上线 Llama 3.1 405B/70B/8B 模型及全栈集成指南

    Hugging Face 正式上架 Meta 发布的 Llama 3.1 系列模型,包含 8B、70B 和 405B 三种尺寸的基座与指令微调版本,以及 Llama Guard 3 和 Prompt Guard 安全模型。

    推荐理由:原文详细列出了 Llama 3.1 各尺寸模型的显存需求、量化方案及微调代码,为开发者评估部署成本和集成路径提供了具体参考。

7月18日周四
  1. Mistral AI82

    Mistral AI 发布与 NVIDIA 合作的 12B 参数模型 Mistral NeMo

    Mistral AI 发布 Mistral NeMo,这是一款与 NVIDIA 合作开发的 12B 参数模型,拥有高达 128k tokens 的上下文窗口。该模型在推理、世界知识和编码准确性方面在其尺寸类别中处于领先地位,并作为 Mistral 7B 的即插即用替代品提供预训练基座和指令微调检查点,采用 Apache 2.0 许可证。

    推荐理由:Mistral NeMo 作为 Mistral 7B 的即插即用替代方案,提供了 128k 上下文窗口和 Apache 2.0 许可,适合需要多语言支持和高效代码压缩的研究者与开发者。

7月16日周二
  1. Mistral AI62

    Mistral AI 发布 Codestral Mamba:基于 Mamba 架构的代码模型

    Mistral AI 发布了 Codestral Mamba,这是继 Mixtral 系列后探索新架构的又一成果。该模型由 Albert Gu 和 Tri Dao 协助设计,利用 Mamba 架构实现线性时间推理和无限长度序列建模的理论能力。

    推荐理由:Mistral AI 发布了基于 Mamba 架构的 Codestral Mamba,该模型在代码生成和推理能力上可与 SOTA Transformer 模型媲美,且支持线性时间推理。

6月27日周四
  1. Hugging Face Blog86

    Google 发布 Gemma 2 开源大语言模型

    Google 发布了最新一代开源大语言模型 Gemma 2,包含 9B 和 27B 两种参数规模的基座与指令微调版本。该模型引入了滑动窗口注意力、Logit 软封顶、知识蒸馏和模型合并等四项主要技术进步,上下文长度为 8K tokens。Hugging Face 已同步提供 Transformers 集成、Inference Endpoints 部署支持以及基于 TRL 的微调示例代码。

    推荐理由:原文详细解析了Gemma 2在滑动窗口注意力、软封顶及知识蒸馏上的技术改进,并提供了基于Transformers的微调与部署指南。