跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

221条精选相关主题产品更新论文研究开源生态

最新精选

第 181–200 条 · 共 221 条
6月12日周三
  1. Hugging Face Blog82

    Hugging Face 集成 Stable Diffusion 3 Medium 模型

    Stable Diffusion 3 Medium(2B 参数)已上线 Hugging Face Hub 并支持通过 🧨 Diffusers 库使用。该模型采用多模态扩散 Transformer (MMDiT) 架构和 Rectified Flow Matching 训练目标,引入了新的 FlowMatchEulerDiscreteScheduler 调度器。

    推荐理由:官方给出了 SD3 Medium 的架构细节、显存优化方案及微调脚本,开发者可据此评估其在不同硬件上的部署可行性。

5月29日周三
  1. Mistral AI83

    Mistral AI 发布首个代码生成模型 Codestral

    Mistral AI 推出其首个专为代码生成设计的开放权重模型 Codestral。该模型参数量为 22B,支持 80 多种编程语言,拥有 32k 上下文窗口,并在 RepoBench 等长程代码生成评测中表现优于竞品。

    推荐理由:官方详细披露了 Codestral 的架构参数、多语言支持及基准测试数据,并明确了非生产许可与商业授权路径,为开发者评估其实际编码能力提供了完整依据。

5月24日周五
  1. Hugging Face Blog68

    TII 发布 Falcon 2 11B LLM 和 VLM 模型

    TII 发布 Falcon 2 系列新模型,包含 11B 参数的基础大语言模型(LLM)和支持图像理解的视觉语言模型(VLM)。

    推荐理由:原文给出了11B参数模型的训练数据规模、架构细节及在英语和多语言基准上的具体评测分数,读者可据此评估其性能与开源可用性。

5月14日周二
  1. Hugging Face Blog82

    谷歌发布开源视觉语言模型 PaliGemma

    谷歌推出开源视觉语言模型家族 PaliGemma,采用 SigLIP-So400m 作为图像编码器、Gemma-2B 作为文本解码器。该模型支持图像与文本输入并输出文本,提供预训练(PT)、混合任务微调(Mix)及特定基准微调(FT)三类检查点,涵盖 224x224、448x448、896x896 三种分辨率及多种精度格式。

    推荐理由:原文详细拆解了PaliGemma的架构组成与推理流程,并提供了基于Transformers的微调代码示例,适合开发者快速上手该开源视觉语言模型。

5月13日周一
  1. OpenAI News84

    OpenAI 发布 GPT-4o 旗舰多模态模型

    OpenAI 正式发布 GPT-4o(GPT-4 Omni),这是一款能够同时处理文本、音频和图像输入并生成相应输出的新旗舰模型。该模型旨在实现更自然的人机交互体验,支持实时语音对话及高级视觉分析功能。

    推荐理由:OpenAI 官方宣布 GPT-4o 发布,强调其作为旗舰模型在音频、视觉和文本处理上的原生多模态能力。

  2. OpenAI News80

    OpenAI 发布新模型

    OpenAI 官方宣布发布新模型。具体型号及能力细节未在标题中明确展示。

    推荐理由:OpenAI 官方宣布新模型发布,提供了最权威的一手信息源。

4月29日周一
  1. Hugging Face Blog61

    Hugging Face 发布 StarCoder2-15B-Instruct-v0.1:首个全透明自对齐代码大模型

    Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个采用完全宽松且透明管道训练的自对齐代码 LLM。该模型利用 StarCoder2-15B 自身生成指令和响应进行微调,在 HumanEval 上取得 72.6 分,超越了 CodeLlama-70B-Instruct。

    推荐理由:展示了完全自对齐的代码模型训练流程,提供了无需蒸馏专有模型即可达到高性能的开源方案。

4月18日周四
  1. Hugging Face Blog92

    Meta 发布 Llama 3 开源大语言模型

    Meta 正式发布 Llama 3 系列开源大语言模型,包含 8B 和 70B 两种参数规模,均提供基础版和指令微调版。该模型采用新 tokenizer 将词汇表扩展至 128,256,并在超过 15 万亿 tokens 的数据上进行了预训练。

    推荐理由:原文详细列出了 Llama 3 的模型规格、训练数据量及在 Hugging Face 生态中的集成方式,为开发者提供了从本地部署到云端推理的具体技术路径。

4月17日周三
  1. Mistral AI82

    Mistral AI 发布开源大模型 Mixtral 8x22B

    Mistral AI 发布最新开源模型 Mixtral 8x22B,采用稀疏混合专家(SMoE)架构,总参数 141B 但仅激活 39B。该模型支持英法意德西五种语言,具备函数调用能力,拥有 64K tokens 上下文窗口,并以最宽松的 Apache 2.0 许可证发布。在 MMLU、HumanEval 等基准测试中,其性能超越其他开源权重模型,且推理速度优于任何稠密 70B 模型。

    推荐理由:官方详细披露了 Mixtral 8x22B 的稀疏激活参数、多语言基准表现及 Apache 2.0 许可,为评估其成本效率与开源价值提供了一手数据。

4月15日周一
  1. Hugging Face Blog70

    Hugging Face 发布 Idefics2:8B 参数开源视觉语言模型

    Hugging Face 正式发布 Idefics2,这是一个拥有8B参数的通用多模态模型,支持文本与图像混合输入及生成。该模型采用 Apache 2.0 许可证开源,显著增强了 OCR 能力,并在 Visual Question Answering 等基准测试中表现优于同尺寸模型,甚至可与 LLava-Next-34B 等更大模型竞争。

    推荐理由:Idefics2 以8B参数和Apache 2.0协议开源,在视觉问答基准上表现优异并简化了微调流程,为社区提供了强大的多模态基础。

4月9日周二
  1. Hugging Face Blog78

    Google 发布 CodeGemma 系列代码大模型

    Google 发布 CodeGemma 系列开源代码大模型,包含 2B 基础版、7B 基础版和 7B 指令微调版,均基于 Gemma 架构并额外使用 5000 亿 token 进行训练。

    推荐理由:原文给出了 CodeGemma 三个版本的训练数据、上下文长度及在 HumanEval 等基准上的表现,读者可据此评估其在代码补全和对话场景中的实际能力。

2月28日周三
  1. Hugging Face Blog82

    BigCode 发布 StarCoder2 系列开源代码大模型及 The Stack v2 数据集

    BigCode 团队发布新一代开源代码大模型 StarCoder2 及其训练数据集 The Stack v2,并开放所有模型权重、数据处理和训练代码。StarCoder2 包含 3B、7B 和 15B 三种参数规模,其中旗舰版 StarCoder2-15B 基于 600 多种编程语言和超过 4 万亿 token 训练,性能在同类尺寸中领先并可媲美 33B+ 模型。

    推荐理由:原文公开了 StarCoder2 系列模型的参数规模、训练数据细节及代码权重,为开发者提供了透明可复现的开源代码大模型选择。

2月26日周一
2月21日周三
  1. Hugging Face Blog86

    Hugging Face 宣布支持 Google 开源大模型 Gemma

    Hugging Face 宣布全面支持 Google 发布的开源大模型 Gemma,提供 Transformers 集成及云端部署方案。Gemma 包含 2B 和 7B 参数版本,支持消费级 GPU 运行,并给出了基于 TRL 的单卡微调示例。

    推荐理由:原文详细说明了 Gemma 在 Hugging Face 生态中的集成方式、硬件适配性及微调流程,为开发者提供了从部署到训练的具体技术路径。

2月15日周四
  1. OpenAI News92

    OpenAI 发布 Sora 文本到视频生成模型

    OpenAI 正式推出名为 Sora 的文本到视频生成模型,能够根据提示词生成长达一分钟的高保真视频。该模型展示了在理解物理世界运动规律方面的显著进展,支持复杂场景和多角色互动。

    推荐理由:官方直接发布了新模型的入口和核心能力说明,读者可据此评估其在视频生成领域的实际表现。

1月4日周四
  1. Hugging Face Blog63

    Hugging Face 发布高效非扩散文本到图像模型 aMUSEd

    Hugging Face 发布了名为 aMUSEd 的高效非扩散文本到图像模型,这是 Google MUSE 的开源复现版本。该模型采用掩码图像建模方法,参数量仅约 800M,支持零样本图像修复,并已在 diffusers 库中集成。用户可通过 LoRA 在 7GB 显存下完成微调,模型遵循 OpenRAIL 许可证允许商业使用。

    推荐理由:原文给出了基于掩码建模的非扩散架构细节及低显存微调方案,读者可据此评估其在推理效率与端侧部署上的实际潜力。

12月11日周一
  1. Mistral AI89

    Mistral AI 发布开源混合专家模型 Mixtral 8x7B

    Mistral AI 发布高质量稀疏混合专家模型(SMoE)Mixtral 8x7B,采用 Apache 2.0 许可开放权重。该模型在大多数基准测试中超越 Llama 2 70B,推理速度提升 6 倍,并在标准基准上匹配或超过 GPT3.5。

    推荐理由:官方详细披露了 Mixtral 8x7B 的稀疏专家架构、性能基准及多语言能力,为开发者评估其成本效益和部署可行性提供了核心依据。

  2. Hugging Face Blog87

    Hugging Face 宣布支持 Mistral 发布的 SOTA 混合专家模型 Mixtral

    Hugging Face 正式支持 Mistral 发布的 Mixtral 8x7b 模型,该模型采用 Mixture of Experts (MoE) 架构,在多个基准测试中超越 GPT-3.5 并创下开源模型新纪录。

    推荐理由:原文详细说明了 Mixtral 在 Hugging Face 生态中的集成方式、推理部署选项及微调示例,为开发者提供了从模型获取到生产环境落地的完整技术路径。

11月6日周一
  1. OpenAI News82

    OpenAI 在 DevDay 发布 GPT-4 Turbo 及开发者产品更新

    OpenAI 在 DevDay 上宣布推出 GPT-4 Turbo 模型以及一系列面向开发者的新产品。此次更新重点包括支持更长上下文窗口的 GPT-4 Turbo,旨在提升模型处理复杂任务的能力并优化开发体验。

    推荐理由:官方在 DevDay 集中发布了新模型与开发者工具,明确了当前 API 能力的升级方向。