AllenAI 发布 Olmo-core 3:面向大规模 MoE 的开源训练基础设施
AllenAI 发布 Olmo-core 3,这是一套专为扩展至万亿参数规模混合专家(MoE)模型设计的开源训练基础设施。该系统通过集成专家并行、流水线并行和分布式优化器等技术,在 NVIDIA B300 GPU 上实现了相比前代约 2.7 倍的训练吞吐量提升,并支持 MXFP8 低精度格式以进一步优化显存占用。
AllenAI 发布 Olmo-core 3,这是一套专为扩展至万亿参数规模混合专家(MoE)模型设计的开源训练基础设施。该系统通过集成专家并行、流水线并行和分布式优化器等技术,在 NVIDIA B300 GPU 上实现了相比前代约 2.7 倍的训练吞吐量提升,并支持 MXFP8 低精度格式以进一步优化显存占用。
NVIDIA 发布开源表格基础模型 Kumo Tabular,支持分类和回归任务,单次前向传播即可完成预测,无需训练、调优或特征工程。该模型提供 28M 至 215M 三种参数规模,完全基于人工合成数据预训练,采用 OpenMDW-1.1 许可证允许商用。
推荐理由:原文展示了无需训练即可预测表格数据的开源基础模型及其在多个基准测试中的精度效率表现,为传统机器学习工作流提供了新的免调优替代方案。
Holo4 是 H Company 推出的新一代智能体模型系列,包含 27B 密集型和 35B-A3B MoE 两种规格,现已上线 H Models API。该模型通过监督学习和强化学习训练,能够灵活调用 GUI、代码、MCP 和 API 等多种接口执行复杂任务。
推荐理由:Holo4 系列模型发布,提供 27B 和 35B-A3B 两种规格,支持 GUI、代码、MCP 和 API 多接口交互,在 OSWorld 2.0 等基准测试中表现优异且成本更低。
Hugging Face 推出针对视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型。该模型通过推测解码技术,在仅增加 8.9% 参数量的前提下,实现设备端最高 3.13 倍、H100 上 2.66 倍的解码加速。目前已支持 llama.cpp、MLX-VLM 和 SGLang,提供 Safetensors 和 GGUF 格式供开源部署。
Hugging Face 推出 NeoMME 260M 和 800M 参数规模的多语言多模态编码器,采用单一双向 Transformer 处理文本与图像补丁。NeoMME-Retriever 在 ViDoRe v3 基准测试中表现优异,260M 版本吞吐量约为 ColModernVBERT 的两倍,并通过层级令牌池化和非对称量化将索引存储减少至每页 6 kB。
推荐理由:原文展示了单Transformer架构在视觉文档检索中的效率突破,提供了从模型权重到代码示例的完整开源实现。
IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B 和 30B 三种尺寸,均基于 Apache 2.0 许可证开源。这些模型通过五阶段策略在约 15T tokens 上预训练,并经过监督微调及多阶段强化学习管道训练,其中 8B 和 30B 版本额外进行了智能体强化学习以支持工具调用。所有模型均支持思考/非思考模式切换及原生工具调用,可通过 vLLM 等框架部署。
推荐理由:原文详细拆解了从预训练到多阶段强化学习的完整技术路径,为开发者提供了复现或评估该系列模型能力的具体参考。
Liquid AI 发布适用于 LFM2.5 系列模型的 DSpark 草稿检查点,通过推测解码技术在不改变输出质量的前提下显著提升推理速度。该方案在 H100 GPU 上最高实现 3.18x 吞吐提升,在 M4 Max MacBook Pro 端侧最高实现 2.87x 加速,并已将 llama.cpp 和 SGLang 的集成代码开源。
推荐理由:原文提供了DSpark草稿模型在GPU和端侧的具体加速数据及开源集成方案,读者可据此评估其在本地部署中的性能收益。
NVIDIA 发布 Magpie Multilingual TTS,这是一个364M参数的开源权重多语言文本转语音模型,最新支持包括阿拉伯语、韩语和巴西葡萄牙语在内的12种语言。
推荐理由:原文给出了 Magpie TTS 新增语言、低延迟实测数据及开源权重部署细节,为构建可控的多语言语音智能体提供了具体参考。
Meta 发布 Muse Glimmer,这是一个专为本地智能体用例设计的 30B 参数多模态模型,采用 Apache 2.0 许可证开源。该模型由 Muse 蒸馏而来,包含 2B ViT 视觉编码器和 28B 文本解码器,支持图像、视频输入及多模态工具调用。
推荐理由:原文给出了30B参数模型的架构细节、基准测试数据及在主流推理框架中的Day-0支持,读者可据此评估其在本地智能体场景下的实际部署能力。
Thinking Machines Lab 在 Hugging Face 发布了 Inkling 系列开源多模态大模型,包含总参数约 1T 的 Inkling 和总参数 276B/激活 12B 的 Inkling-Small。
推荐理由:原文给出了1T参数全模态模型的架构细节与部署配置,读者可以据此评估其在多模态推理任务中的实际能力。
Mistral AI 发布 Leanstral 1.5,这是一款 Apache-2.0 许可的开源模型,拥有 119B 总参数和 6B 激活参数。该模型在 miniF2F 上达到饱和,并在 FATE-H/X 上取得新的 state-of-the-art 成绩,其解决 PutnamBench 问题的成本约为每问题 $4,远低于竞品。
推荐理由:原文展示了该模型在形式化验证基准上的性能突破及低成本优势,并提供了实际代码缺陷发现案例,为评估其在工程实践中的可用性提供了具体依据。
Google Research 发布专为表格数据分类和回归设计的零样本基础模型 TabFM。该模型将表格预测重构为上下文学习问题,利用混合注意力架构和在数亿合成数据集上的预训练,无需手动特征工程或超参数调整即可在单次前向传播中生成高质量预测。
推荐理由:Google Research 推出面向表格数据的零样本基础模型 TabFM,通过上下文学习消除传统监督模型的训练与调优瓶颈。
PaddlePaddle 在 Hugging Face 发布 PP-OCRv6,提供 tiny、small 和 medium 三个档位,参数量从 1.5M 到 34.5M。
智谱(Z.ai)发布最新旗舰模型 GLM-5.2,主打长程任务处理能力并首次提供稳定的 1M-token 上下文窗口。该模型采用 IndexShare 架构降低计算成本,在 FrontierSWE、PostTrainBench 等长程编码基准中表现优于多数闭源模型,成为排名第一的开源模型。
推荐理由:原文给出了1M上下文在长程编码任务中的实测表现与架构优化细节,读者可以据此判断其作为开源旗舰模型的实际工程落地能力。
Hcompany 发布 Holo3.1 系列计算机使用模型,旨在提升在 Web、桌面和移动环境以及不同 Agent 框架下的鲁棒性。该系列包含 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化检查点以支持本地推理。
推荐理由:原文给出了跨环境鲁棒性提升及首次发布的量化权重,读者可据此评估本地化部署的可行性与性能损耗。
Hugging Face 推出 OlmoEarth v1.1 地球观测模型家族,通过优化 Transformer token 序列长度,将计算成本降低至上一代的三分之一。该版本在保持与 OlmoEarth v1 相当性能的同时,显著提升了推理效率,支持 Base、Tiny 和 Nano 三种规格,使大规模卫星影像处理更经济高效。
Hugging Face 发布了基于 ModernBERT 的 Ettin Reranker 系列共六个 CrossEncoder 重排器,参数量从 17M 到 1B。
推荐理由:原文给出了六个尺寸的重排器及其训练配方,读者可以据此评估其在检索管线中的性能与部署成本。
IBM 发布两款基于 ModernBERT 架构的 Apache 2.0 多语言嵌入模型 granite-embedding-97m-multilingual-r2 和 granite-embedding-311m-multilingual-r2。
推荐理由:IBM 发布了基于 ModernBERT 架构的 Apache 2.0 多语言嵌入模型,在保持轻量级的同时显著提升了长文档和代码检索能力。
IBM 发布 Granite 4.1 系列大语言模型(3B、8B、30B),采用 Apache 2.0 许可证开源。该系列基于约 15T tokens 进行五阶段预训练,上下文窗口扩展至 512K,并通过监督微调和多阶段强化学习优化。其中 8B 稠密模型在指令遵循和工具调用等任务上表现匹敌甚至超越前代 32B MoE 模型,提供了可预测的延迟和更低成本的企业级解决方案。
推荐理由:原文详细拆解了从预训练到多阶段强化学习的全流程,展示了如何通过严格的数据工程让8B稠密模型在多项指标上匹敌32B MoE架构。
NVIDIA 发布 Nemotron 3 Nano Omni,这是一款支持文本、图像、视频和音频的全模态理解模型。该模型采用 Mamba-Transformer MoE 混合骨干网络,在 OCRBenchV2 和 WorldSense 等基准测试中表现优异,并针对长文档分析和智能体计算机使用进行了优化。BF16、FP8 和 NVFP4 检查点已在 Hugging Face 开放下载。
推荐理由:原文给出了混合架构细节与多基准实测数据,读者可以据此评估其在长文档和音视频联合理解任务中的实际能力边界。
DeepSeek 发布 V4 系列模型,包含 DeepSeek-V4-Pro(1.6T 总参数/49B 激活)和 DeepSeek-V4-Flash(284B 总参数/13B 激活),均支持 1M-token 上下文窗口。
推荐理由:原文详细拆解了 DeepSeek-V4 通过混合注意力机制大幅降低长上下文推理成本的技术细节,并展示了其在智能体任务中的具体性能表现。
Overworld 发布新一代实时视频世界模型 Waypoint-1.5,旨在让交互式生成世界能在用户现有的消费级硬件上运行。该模型提供两个版本:720p/60 FPS 版本适用于 RTX 3090 至 5090 等高性能桌面显卡,360p 版本则针对游戏笔记本及即将支持的 Apple Silicon Macs 优化以覆盖更广泛的设备。
推荐理由:原文给出了在消费级硬件上运行实时交互世界模型的具体参数与双版本策略,读者可据此评估本地部署的可行性。
Gemma 4 系列多模态模型正式发布,包含 E2B、E4B、12B Unified、31B 和 26B A4B 五种尺寸,支持图像、文本和音频输入,采用 Apache 2.0 许可证。
推荐理由:原文给出了五种尺寸的多模态架构细节与跨框架部署方案,读者可据此评估其在端侧推理和智能体工作流中的实际可用性。
Technology Innovation Institute (TII) 发布 Falcon Perception(0.6B 参数)和 Falcon OCR(0.3B 参数),两者均采用单一早期融合 Transformer 架构处理图像补丁与文本。
推荐理由:原文展示了早期融合架构在开放词汇分割与OCR任务上的性能优势及推理细节,为小参数模型替代复杂视觉管线提供了可复用的技术路径。
IBM 在 Hugging Face 发布 Granite 4.0 3B Vision,这是一款基于 Apache 2.0 许可的紧凑视觉语言模型,专为企业文档理解设计。
H Company 发布 Holotron-12B,这是一个基于 NVIDIA Nemotron-Nano-2 VL 后训练的多模态计算机使用模型。该模型采用混合 SSM 和注意力机制,在单张 H100 GPU 上实现了比 Holo2-8B 高 2 倍以上的吞吐量,并在 WebVoyager 基准测试中将性能从 35.1% 提升至 80.5%。
Mistral AI 发布 Voxtral Transcribe 2,包含面向批量处理的 Voxtral Mini Transcribe V2 和面向实时应用的 Voxtral Realtime。
推荐理由:官方发布了具备超低延迟和说话人分离能力的新一代语音转文字模型,其中实时版以 Apache 2.0 协议开源,提供了具体的性能基准和定价信息。
Hugging Face 推出 mmBERT,这是首个在性能上超越 XLM-R 的多语言编码器模型。该模型基于 ModernBERT 架构,使用超过 3T tokens 和 1800+ 种语言数据训练,包含 110M 参数的 base 版本。mmBERT 通过三阶段渐进式训练策略,显著提升了低资源语言的学习效率与多语言理解能力。
Google DeepMind 发布 EmbeddingGemma,这是一款拥有 308M 参数、支持 100 多种语言的开源多语言文本嵌入模型。该模型基于 Gemma3 架构并采用双向注意力机制,量化后内存占用低于 200 MB,在 MTEB 排行榜上位居同尺寸纯文本模型前列。
推荐理由:原文展示了308M参数模型在MMTEB上的表现及多框架集成方案,读者可据此评估其在移动端RAG和检索任务中的落地可行性。
NVIDIA 发布包含法语、西班牙语等五种语言的 6 Million Multilingual Reasoning Dataset,并推出基于 Hybrid Transformer–Mamba 架构的 Nemotron Nano 2 9B 模型。该模型支持可配置 thinking budget,token 生成速度最高提升 6×,推理成本降低 60%,权重已在 Hugging Face 开源。
Hugging Face 开源 Kimina-Prover-RL 训练管线,基于 DeepSeek-R1 范式与 Verl 框架实现 Lean 4 定理证明。配套发布的 AI-MO/Kimina-Prover-RL-1.7B 在 MiniF2F 基准 Pass@32 达 76.63%,0.6B 版本达 71.30%,均创同尺寸开源模型新纪录。
OpenAI 发布了名为 GPT OSS 的开源权重模型家族,包含 gpt-oss-120b 和 gpt-oss-20b 两个混合专家(MoE)模型,均采用 MXFP4 量化并遵循 Apache 2.0 许可证。
推荐理由:原文详细说明了 GPT OSS 的架构特性、量化方案及在主流框架下的本地部署与微调方法,为开发者提供了从云端 API 到端侧运行的完整技术路径。
NVIDIA AI-Q 在 DeepResearch Bench“LLM with Search”类别中以 40.52 分登顶,成为首个完全开源且领先的深度研究智能体。
Hugging Face 推出 Ettin Suite,这是首个包含 SoTA 配对编码器(17M-1B 参数)和解码器模型的套件,两者使用完全相同的开放数据(2T tokens)、架构和训练配方进行训练。
推荐理由:提供了在相同数据和训练配方下对比编码器与解码器架构的受控实验结果,有助于理解不同架构在分类、检索和生成任务上的固有优势。
Mistral AI 发布开源语音理解模型 Voxtral,包含适用于生产环境的 24B 版本和适用于本地/边缘部署的 3B 版本(Voxtral Mini),均采用 Apache 2.0 许可证。
推荐理由:原文给出了两种参数规模的开源语音理解模型及其在转录和语义理解上的基准表现,读者可以据此评估其在本地部署或生产环境中的成本与能力平衡。
Numina 与 Kimi Team 联合发布基于 Qwen2.5-72B 训练的 Kimina-Prover-72B 及两个蒸馏版本(8B/1.7B),在 miniF2F 基准上达到 92.2% 的 pass@1024 通过率。
Hugging Face 推出完全开源的 3B 参数模型 SmolLM3,包含 Base 和 Instruct/Reasoning 版本,支持英语、法语等 6 种语言及最高 128k 上下文窗口。
推荐理由:Hugging Face 发布了 SmolLM3 及其完整训练配方,展示了在 3B 规模下通过公开数据实现长上下文和双模式推理的工程路径。
NVIDIA 推出 Llama Nemotron Nano VL,这是一款基于 Llama-3.1-8B-Instruct 和 C-RADIOv2-VLM-H 架构的 8B 参数视觉语言模型,专为智能文档处理和 OCR 设计。
推荐理由:原文给出了8B视觉语言模型在文档处理基准上的表现及部署入口,读者可以据此判断其在企业级自动化场景中的适用性。
Gemma 3n现已全面支持transformers、timm、MLX、llama.cpp、Ollama等主流开源库,实现本地化多模态运行。该模型包含E2B和E4B两种规格,通过Per-Layer Embeddings技术将实际5B/8B参数的显存占用降至2GB/3GB,并首次引入MobileNet-v5视觉编码器与USM音频编码器。
推荐理由:原文详细列出了Gemma 3n在主流开源库中的集成方式及显存优化原理,为开发者提供了从推理到微调的完整落地路径。
H Company 在 Hugging Face Hub 上发布了 Holo1 系列动作视觉语言模型(Action VLMs)和 WebClick 基准测试。该系列包含 Holo1-3B 和 Holo1-7B 两个版本,基于 Qwen2.5-VL 架构,其中 Holo1-7B 在通用 UI 定位基准上达到 76.2% 的平均准确率。
推荐理由:原文发布了专为GUI自动化设计的开源视觉语言模型家族及基准,提供了低成本实现网页任务自动化的具体性能数据。