OpenAI 发布 Sora 文本生成视频模型
OpenAI 正式推出 Sora,这是一款能够根据文本提示词生成长达一分钟视频的 AI 模型。该模型能准确理解用户的指令并呈现复杂的场景、角色和多镜头叙事。Sora 目前向部分测试用户开放,旨在展示其在模拟物理世界方面的能力。
推荐理由:官方直接宣布新模型上线,提供了最权威的能力定义和访问入口信息。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
OpenAI 正式推出 Sora,这是一款能够根据文本提示词生成长达一分钟视频的 AI 模型。该模型能准确理解用户的指令并呈现复杂的场景、角色和多镜头叙事。Sora 目前向部分测试用户开放,旨在展示其在模拟物理世界方面的能力。
推荐理由:官方直接宣布新模型上线,提供了最权威的能力定义和访问入口信息。
Hugging Face 博客介绍了 Google 新发布的 PaliGemma 2 视觉语言模型,该模型结合了 SigLIP 图像编码器与 Gemma 2 语言模型,提供 3B、10B 和 28B 三种参数规模,并支持 224x224、448x448 和 896x896 多种输入分辨率。
推荐理由:原文给出了PaliGemma 2的多尺寸变体、分辨率支持及量化性能数据,读者可据此评估其在不同算力条件下的微调潜力与部署成本。
Hugging Face 发布 SmolVLM,这是一款参数量为 2B 的视觉语言模型,在 transformers 库中实现了最低的显存占用(约 5.02 GB)。
推荐理由:SmolVLM 在保持视觉问答能力的同时将显存占用降至约 5GB,为端侧部署和低成本微调提供了具体的性能基准与开源训练配方。
Mistral AI 发布 Pixtral Large,这是一个基于 Mistral Large 2 构建的 124B 参数开源权重多模态模型。该模型包含 123B 的多模态解码器和 1B 参数的视觉编码器,支持 128K 上下文窗口,能容纳至少 30 张高分辨率图像。
推荐理由:原文给出了124B参数规模、128K上下文窗口及在MathVista等基准上的具体得分,读者可据此评估其图像理解能力与开源权重可用性。
Cohere For AI 团队发布 Aya Expanse 系列开源权重模型,包含 8B 和 32B 参数版本,旨在解决多语言模型性能落后于单语模型的挑战。
推荐理由:原文详细拆解了通过数据套利、偏好训练和模型合并提升多语言性能的技术路径,为开发者提供了可复用的训练策略参考。
Stable Diffusion 3.5 Large 及其 timestep-distilled 版本已上线 Hugging Face Hub,并支持通过 🧨 Diffusers 使用。
推荐理由:原文提供了 SD3.5 Large 在 Diffusers 中的推理、量化及 LoRA 训练代码,帮助开发者快速集成新模型。
Mistral AI 在 Mistral 7B 发布一周年之际推出两款新模型 Ministral 3B 和 Ministral 8B,旨在优化设备端和边缘计算场景。
推荐理由:官方公布了两款小参数模型的基准表现与定价,为边缘计算场景提供了具体的选型参考。
Hugging Face 宣布上线 Llama 3.2 系列共10个开放权重模型,包含支持视觉理解的 11B 和 90B 多模态版本,以及适用于端侧运行的 1B 和 3B 文本模型。其中 3B Instruct 版本在 IFEval 指令遵循基准上表现优异,且所有模型均已完成 Transformers、TGI 等主流框架的集成适配。需注意欧盟地区用户无法获得多模态版本的商业使用授权。
推荐理由:原文详细列出了Llama 3.2系列模型的参数规模、基准测试数据及在Hugging Face生态中的部署方法,为开发者评估其视觉理解与端侧运行能力提供了直接依据。
Mistral AI 发布原生多模态模型 Pixtral 12B,采用 Apache 2.0 许可证开源。该模型基于 Mistral Nemo 架构,支持 128k token 长上下文和可变图像尺寸,在 MMMU 基准测试中达到 52.5%,旨在作为 Mistral Nemo 12B 的直接替代品,兼顾多模态理解与文本指令遵循能力。
推荐理由:官方发布了原生多模态模型 Pixtral 12B,在保持文本性能的同时提升了视觉推理能力,并提供了多种部署方式。
OpenAI 官方宣布推出 OpenAI o1 模型。
OpenAI 发布 o1-mini 模型,主打成本高效的推理能力。
Technology Innovation Institute (TII) 发布了基于 Mamba 架构的 7B 参数大语言模型 Falcon Mamba,采用 TII Falcon Mamba 7B License 1.0 协议开源。
推荐理由:TII 在 Hugging Face 博客详细披露了 Falcon Mamba 的架构设计、训练数据及基准测试对比,展示了纯 SSM 模型在长序列处理上的效率优势。
Google 在 Hugging Face 博客宣布扩展 Gemma 模型家族,新增 Gemma 2 2B、ShieldGemma 安全分类器和 Gemma Scope 稀疏自编码器套件。
推荐理由:原文详细展示了 Gemma 2 2B 在端侧部署与辅助生成中的具体用法,以及 ShieldGemma 和 Gemma Scope 的开源特性,为开发者提供了可落地的技术参考。
Mistral AI 正式发布新一代大模型 Mistral Large 2,拥有 1230 亿参数并支持 128k 上下文窗口。该模型针对单节点推理优化,在多语言处理、代码生成及逻辑推理方面性能显著提升,并在 MMLU 等基准测试中达到新的高度。
推荐理由:官方公布 Mistral Large 2 的架构参数、多语言支持及在主流基准测试中的性能表现,为评估其成本效益和实际部署能力提供直接依据。
Hugging Face 正式上架 Meta 发布的 Llama 3.1 系列模型,包含 8B、70B 和 405B 三种尺寸的基座与指令微调版本,以及 Llama Guard 3 和 Prompt Guard 安全模型。
推荐理由:原文详细列出了 Llama 3.1 各尺寸模型的显存需求、量化方案及微调代码,为开发者评估部署成本和集成路径提供了具体参考。
OpenAI 发布了 GPT-4o mini。
Mistral AI 发布 Mistral NeMo,这是一款与 NVIDIA 合作开发的 12B 参数模型,拥有高达 128k tokens 的上下文窗口。该模型在推理、世界知识和编码准确性方面在其尺寸类别中处于领先地位,并作为 Mistral 7B 的即插即用替代品提供预训练基座和指令微调检查点,采用 Apache 2.0 许可证。
推荐理由:Mistral NeMo 作为 Mistral 7B 的即插即用替代方案,提供了 128k 上下文窗口和 Apache 2.0 许可,适合需要多语言支持和高效代码压缩的研究者与开发者。
Mistral AI 发布了 Codestral Mamba,这是继 Mixtral 系列后探索新架构的又一成果。该模型由 Albert Gu 和 Tri Dao 协助设计,利用 Mamba 架构实现线性时间推理和无限长度序列建模的理论能力。
推荐理由:Mistral AI 发布了基于 Mamba 架构的 Codestral Mamba,该模型在代码生成和推理能力上可与 SOTA Transformer 模型媲美,且支持线性时间推理。
Hugging Face 推出 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三种参数规模,并同步开源了用于训练的 SmolLM-Corpus 数据集。
推荐理由:官方开源了SmolLM系列小模型及其高质量训练语料,展示了在端侧设备上的优异性能与数据构建细节。
Google 发布了最新一代开源大语言模型 Gemma 2,包含 9B 和 27B 两种参数规模的基座与指令微调版本。该模型引入了滑动窗口注意力、Logit 软封顶、知识蒸馏和模型合并等四项主要技术进步,上下文长度为 8K tokens。Hugging Face 已同步提供 Transformers 集成、Inference Endpoints 部署支持以及基于 TRL 的微调示例代码。
推荐理由:原文详细解析了Gemma 2在滑动窗口注意力、软封顶及知识蒸馏上的技术改进,并提供了基于Transformers的微调与部署指南。