OpenAI 发布新模型更新
OpenAI 于 2024-12-20 发布了一项新的模型更新。
OpenAI 于 2024-12-20 发布了一项新的模型更新。
Answer.AI 和 LightOn 发布 ModernBERT,这是一系列基于 Transformer++ 架构的 state-of-the-art 编码器模型,旨在全面替代 BERT。
推荐理由:ModernBERT 将 LLM 架构改进引入编码器,提供 8k 上下文和代码理解能力,为检索和分类任务带来显著效率提升。
IBM、普林斯顿大学、卡内基梅隆大学和伊利诺伊大学香槟分校联合推出 Bamba-9B,这是一款完全使用开放数据训练的混合 Mamba2 模型。在 vLLM 框架下,该模型相比标准 Transformer 实现了 2.5 倍吞吐量提升和 2 倍延迟加速。目前模型已支持 transformers、vLLM、TRL 和 llama.cpp,并公开了包含有状态数据加载器在内的训练与微调配方。
推荐理由:IBM 联合高校发布基于开放数据训练的混合 Mamba2 模型,提供显著推理效率提升及完整训练复现资源。
OpenAI 官方新闻源发布了一条关于新模型的公告,具体型号及详细能力参数未在标题或摘要中明确列出。
Technology Innovation Institute (TII) 发布了 Falcon3 系列开源大语言模型,包含 1B、3B、7B、10B 以及 Mamba-7B 五个基础模型版本。
推荐理由:原文详细列出了Falcon3系列各尺寸模型的基准测试得分及训练创新点,读者可据此评估其在小参数规模下的性能表现与开源许可适用性。
OpenAI 正式推出 Sora,这是一款能够根据文本提示词生成长达一分钟视频的 AI 模型。该模型能准确理解用户的指令并呈现复杂的场景、角色和多镜头叙事。Sora 目前向部分测试用户开放,旨在展示其在模拟物理世界方面的能力。
推荐理由:官方直接宣布新模型上线,提供了最权威的能力定义和访问入口信息。
OpenAI 发布视频生成模型 Sora 的系统卡。Sora 支持文本、图像及视频输入,能生成全新视频,其设计基于 DALL-E 和 GPT 模型的经验,旨在为用户提供扩展的故事讲述与创意表达工具。
Hugging Face 博客介绍了 Google 新发布的 PaliGemma 2 视觉语言模型,该模型结合了 SigLIP 图像编码器与 Gemma 2 语言模型,提供 3B、10B 和 28B 三种参数规模,并支持 224x224、448x448 和 896x896 多种输入分辨率。
推荐理由:原文给出了PaliGemma 2的多尺寸变体、分辨率支持及量化性能数据,读者可据此评估其在不同算力条件下的微调潜力与部署成本。
Hugging Face 发布 SmolVLM,这是一款参数量为 2B 的视觉语言模型,在 transformers 库中实现了最低的显存占用(约 5.02 GB)。
推荐理由:SmolVLM 在保持视觉问答能力的同时将显存占用降至约 5GB,为端侧部署和低成本微调提供了具体的性能基准与开源训练配方。
Mistral AI 发布 Pixtral Large,这是一个基于 Mistral Large 2 构建的 124B 参数开源权重多模态模型。该模型包含 123B 的多模态解码器和 1B 参数的视觉编码器,支持 128K 上下文窗口,能容纳至少 30 张高分辨率图像。
推荐理由:原文给出了124B参数规模、128K上下文窗口及在MathVista等基准上的具体得分,读者可据此评估其图像理解能力与开源权重可用性。
Cohere For AI 团队发布 Aya Expanse 系列开源权重模型,包含 8B 和 32B 参数版本,旨在解决多语言模型性能落后于单语模型的挑战。
推荐理由:原文详细拆解了通过数据套利、偏好训练和模型合并提升多语言性能的技术路径,为开发者提供了可复用的训练策略参考。
Stable Diffusion 3.5 Large 及其 timestep-distilled 版本已上线 Hugging Face Hub,并支持通过 🧨 Diffusers 使用。
推荐理由:原文提供了 SD3.5 Large 在 Diffusers 中的推理、量化及 LoRA 训练代码,帮助开发者快速集成新模型。
Mistral AI 在 Mistral 7B 发布一周年之际推出两款新模型 Ministral 3B 和 Ministral 8B,旨在优化设备端和边缘计算场景。
推荐理由:官方公布了两款小参数模型的基准表现与定价,为边缘计算场景提供了具体的选型参考。
Hugging Face 宣布上线 Llama 3.2 系列共10个开放权重模型,包含支持视觉理解的 11B 和 90B 多模态版本,以及适用于端侧运行的 1B 和 3B 文本模型。其中 3B Instruct 版本在 IFEval 指令遵循基准上表现优异,且所有模型均已完成 Transformers、TGI 等主流框架的集成适配。需注意欧盟地区用户无法获得多模态版本的商业使用授权。
推荐理由:原文详细列出了Llama 3.2系列模型的参数规模、基准测试数据及在Hugging Face生态中的部署方法,为开发者评估其视觉理解与端侧运行能力提供了直接依据。
Mistral AI 发布原生多模态模型 Pixtral 12B,采用 Apache 2.0 许可证开源。该模型基于 Mistral Nemo 架构,支持 128k token 长上下文和可变图像尺寸,在 MMMU 基准测试中达到 52.5%,旨在作为 Mistral Nemo 12B 的直接替代品,兼顾多模态理解与文本指令遵循能力。
推荐理由:官方发布了原生多模态模型 Pixtral 12B,在保持文本性能的同时提升了视觉推理能力,并提供了多种部署方式。
OpenAI 官方宣布推出 OpenAI o1 模型。
OpenAI 发布 o1-mini 模型,主打成本高效的推理能力。
OpenAI 发布 o1 Contributions。
Technology Innovation Institute (TII) 发布了基于 Mamba 架构的 7B 参数大语言模型 Falcon Mamba,采用 TII Falcon Mamba 7B License 1.0 协议开源。
推荐理由:TII 在 Hugging Face 博客详细披露了 Falcon Mamba 的架构设计、训练数据及基准测试对比,展示了纯 SSM 模型在长序列处理上的效率优势。
Google 在 Hugging Face 博客宣布扩展 Gemma 模型家族,新增 Gemma 2 2B、ShieldGemma 安全分类器和 Gemma Scope 稀疏自编码器套件。
推荐理由:原文详细展示了 Gemma 2 2B 在端侧部署与辅助生成中的具体用法,以及 ShieldGemma 和 Gemma Scope 的开源特性,为开发者提供了可落地的技术参考。
Mistral AI 正式发布新一代大模型 Mistral Large 2,拥有 1230 亿参数并支持 128k 上下文窗口。该模型针对单节点推理优化,在多语言处理、代码生成及逻辑推理方面性能显著提升,并在 MMLU 等基准测试中达到新的高度。
推荐理由:官方公布 Mistral Large 2 的架构参数、多语言支持及在主流基准测试中的性能表现,为评估其成本效益和实际部署能力提供直接依据。
Hugging Face 正式上架 Meta 发布的 Llama 3.1 系列模型,包含 8B、70B 和 405B 三种尺寸的基座与指令微调版本,以及 Llama Guard 3 和 Prompt Guard 安全模型。
推荐理由:原文详细列出了 Llama 3.1 各尺寸模型的显存需求、量化方案及微调代码,为开发者评估部署成本和集成路径提供了具体参考。
OpenAI 发布了 GPT-4o mini。
Mistral AI 发布 Mistral NeMo,这是一款与 NVIDIA 合作开发的 12B 参数模型,拥有高达 128k tokens 的上下文窗口。该模型在推理、世界知识和编码准确性方面在其尺寸类别中处于领先地位,并作为 Mistral 7B 的即插即用替代品提供预训练基座和指令微调检查点,采用 Apache 2.0 许可证。
推荐理由:Mistral NeMo 作为 Mistral 7B 的即插即用替代方案,提供了 128k 上下文窗口和 Apache 2.0 许可,适合需要多语言支持和高效代码压缩的研究者与开发者。
Mistral AI 推出 Mathstral,该模型基于 Mistral 7B 构建,专攻 STEM 领域复杂逻辑推理。Mathstral 在 MATH 基准测试中得分 56.6%,MMLU 得分 63.47%;结合多数投票机制后,MATH 分数提升至 68.37%。
Mistral AI 发布了 Codestral Mamba,这是继 Mixtral 系列后探索新架构的又一成果。该模型由 Albert Gu 和 Tri Dao 协助设计,利用 Mamba 架构实现线性时间推理和无限长度序列建模的理论能力。
推荐理由:Mistral AI 发布了基于 Mamba 架构的 Codestral Mamba,该模型在代码生成和推理能力上可与 SOTA Transformer 模型媲美,且支持线性时间推理。
Hugging Face 推出 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三种参数规模,并同步开源了用于训练的 SmolLM-Corpus 数据集。
推荐理由:官方开源了SmolLM系列小模型及其高质量训练语料,展示了在端侧设备上的优异性能与数据构建细节。
OpenAI 发布了名为 CriticGPT 的新模型,该模型基于 GPT-4 构建,专门用于对 ChatGPT 的回答生成批评意见。其核心目的是在 RLHF(基于人类反馈的强化学习)过程中,帮助人类训练师更准确地识别 ChatGPT 回答中的错误。
Google 发布了最新一代开源大语言模型 Gemma 2,包含 9B 和 27B 两种参数规模的基座与指令微调版本。该模型引入了滑动窗口注意力、Logit 软封顶、知识蒸馏和模型合并等四项主要技术进步,上下文长度为 8K tokens。Hugging Face 已同步提供 Transformers 集成、Inference Endpoints 部署支持以及基于 TRL 的微调示例代码。
推荐理由:原文详细解析了Gemma 2在滑动窗口注意力、软封顶及知识蒸馏上的技术改进,并提供了基于Transformers的微调与部署指南。
Stable Diffusion 3 Medium(2B 参数)已上线 Hugging Face Hub 并支持通过 🧨 Diffusers 库使用。该模型采用多模态扩散 Transformer (MMDiT) 架构和 Rectified Flow Matching 训练目标,引入了新的 FlowMatchEulerDiscreteScheduler 调度器。
推荐理由:官方给出了 SD3 Medium 的架构细节、显存优化方案及微调脚本,开发者可据此评估其在不同硬件上的部署可行性。
OpenAI 深入解析其文本转语音模型 Voice Engine 的技术原理,并分享相关安全研究成果。该文章重点探讨了支撑这一语音合成技术的底层机制及相应的安全防护措施。
Mistral AI 推出其首个专为代码生成设计的开放权重模型 Codestral。该模型参数量为 22B,支持 80 多种编程语言,拥有 32k 上下文窗口,并在 RepoBench 等长程代码生成评测中表现优于竞品。
推荐理由:官方详细披露了 Codestral 的架构参数、多语言支持及基准测试数据,并明确了非生产许可与商业授权路径,为开发者评估其实际编码能力提供了完整依据。
TII 发布 Falcon 2 系列新模型,包含 11B 参数的基础大语言模型(LLM)和支持图像理解的视觉语言模型(VLM)。
推荐理由:原文给出了11B参数模型的训练数据规模、架构细节及在英语和多语言基准上的具体评测分数,读者可据此评估其性能与开源可用性。
谷歌推出开源视觉语言模型家族 PaliGemma,采用 SigLIP-So400m 作为图像编码器、Gemma-2B 作为文本解码器。该模型支持图像与文本输入并输出文本,提供预训练(PT)、混合任务微调(Mix)及特定基准微调(FT)三类检查点,涵盖 224x224、448x448、896x896 三种分辨率及多种精度格式。
推荐理由:原文详细拆解了PaliGemma的架构组成与推理流程,并提供了基于Transformers的微调代码示例,适合开发者快速上手该开源视觉语言模型。
OpenAI 正式发布 GPT-4o(GPT-4 Omni),这是一款能够同时处理文本、音频和图像输入并生成相应输出的新旗舰模型。该模型旨在实现更自然的人机交互体验,支持实时语音对话及高级视觉分析功能。
推荐理由:OpenAI 官方宣布 GPT-4o 发布,强调其作为旗舰模型在音频、视觉和文本处理上的原生多模态能力。
OpenAI 官方宣布发布新模型。具体型号及能力细节未在标题中明确展示。
推荐理由:OpenAI 官方宣布新模型发布,提供了最权威的一手信息源。
OpenAI 于 2024-05-13 通过官方新闻源发布新模型,具体型号及能力细节未在标题中披露。
Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个采用完全宽松且透明管道训练的自对齐代码 LLM。该模型利用 StarCoder2-15B 自身生成指令和响应进行微调,在 HumanEval 上取得 72.6 分,超越了 CodeLlama-70B-Instruct。
推荐理由:展示了完全自对齐的代码模型训练流程,提供了无需蒸馏专有模型即可达到高性能的开源方案。
Hugging Face 推出 Jack of All Trades (JAT) 项目,发布首个用于训练通才代理的数据集及基于 GPT-Neo 的多模态 Transformer 模型。该模型在 Atari、BabyAI 等 157 个任务上平均达到专家性能的 65.8%,其中 BabyAI 得分高达 99.0%。
Meta 正式发布 Llama 3 系列开源大语言模型,包含 8B 和 70B 两种参数规模,均提供基础版和指令微调版。该模型采用新 tokenizer 将词汇表扩展至 128,256,并在超过 15 万亿 tokens 的数据上进行了预训练。
推荐理由:原文详细列出了 Llama 3 的模型规格、训练数据量及在 Hugging Face 生态中的集成方式,为开发者提供了从本地部署到云端推理的具体技术路径。