AllenAI 发布 Olmo-core 3:面向大规模 MoE 的开源训练基础设施
AllenAI 发布 Olmo-core 3,这是一套专为扩展至万亿参数规模混合专家(MoE)模型设计的开源训练基础设施。该系统通过集成专家并行、流水线并行和分布式优化器等技术,在 NVIDIA B300 GPU 上实现了相比前代约 2.7 倍的训练吞吐量提升,并支持 MXFP8 低精度格式以进一步优化显存占用。
AllenAI 发布 Olmo-core 3,这是一套专为扩展至万亿参数规模混合专家(MoE)模型设计的开源训练基础设施。该系统通过集成专家并行、流水线并行和分布式优化器等技术,在 NVIDIA B300 GPU 上实现了相比前代约 2.7 倍的训练吞吐量提升,并支持 MXFP8 低精度格式以进一步优化显存占用。
NVIDIA 启动第 26 届研究生奖学金计划,面向全球 AI、机器人等领域博士生开放申请。该计划提供最高 $60,000 的资助及导师支持,累计已发放逾 220 项 grant。申请人须完成至少一年博士课程并参加 2027 年暑期实习,截止日期为 2026 年 10 月 30 日。
微软研究院发布 Quine,这是一个结合生物学世界模型与交互式工具链的 AI 研究系统,旨在连接模型、科学工具、文献及研究人员。该系统在胰腺导管腺癌(PDAC)研究中应用,仅用一个周末即完成了从缩小化合物搜索空间到确定候选药物的过程,并验证了多个排名靠前的化合物能驱动肿瘤细胞状态转变。
推荐理由:微软研究院推出Quine,通过多模态世界模型与实验闭环加速生物发现,并在胰腺癌研究中验证了化合物筛选效率。
NVIDIA与Google DeepMind等机构合作,在AlphaFold Database中开放了超过2,800种病毒的预测3D蛋白复合物结构。该数据集利用AlphaFold2模型结合NVIDIA BioNeMo Inference Runtime生成,旨在帮助科学家提前储备应对未来大流行的知识。
Google Research 与 HHMI Janelia 等机构合作,在《Cell》发表迄今最大的雄性果蝇大脑及中枢神经系统完整连接组图谱。该图谱包含超过 16.6 万个神经元和 1.25 亿个突触连接,通过 Neuroglancer 工具提供可视化与下载。这一成果利用 AI 技术加速了从电子显微镜图像到 3D 神经重建的过程,为研究动物感知、刺激反应及神经修复提供了基础资源。
Hugging Face 发布教程,演示如何使用 TRL 库和 GRPO 算法微调 LFM2.5-350M 模型以改善结构化输出能力。该方案仅需约 500 个样本和 100 步训练,可在免费 Colab 或 Kaggle GPU 上运行,使模型在 IFStruct 基准测试中的得分从 22.6% 提升至 29.7%,显著缩小了与小参数模型和大模型之间的差距。
推荐理由:展示了在免费 GPU 上通过少量步骤微调小模型以提升结构化输出合规性的完整流程与实测效果。
作者基于 Hugging Face 平台完整复现了通过强化学习训练大语言模型编写 JavaScript 代码以生成水彩画的过程,并开源了所有训练脚本、环境和数据集。文章详细解析了结合 HPSv3 评分与 Qwen3-VL-30B-A3B-Instruct 视觉判断器的奖励机制设计,对比了三种不同权重配置的实验结果,展示了如何利用人工筛选的图像池引导模型学习特定审美风格。
推荐理由:完整公开了基于TRL和OpenEnv的强化学习训练代码、环境配置及三种奖励混合策略的实验对比,为复现美学偏好模型提供了可迁移的工程参考。
Sentence Transformers v6.0 引入 MultiVectorEncoder 以支持 ColBERT 风格的后期交互检索,本文详解其微调流程。作者展示了如何在单张 RTX 3090 上通过 14.5 小时训练出超越通用模型的医疗领域检索器,并提供了从数据加载、损失函数选择到索引优化的完整代码示例。
推荐理由:原文给出了多向量模型微调的完整代码与实测对比,读者可据此在单卡上复现针对特定领域的检索增强方案。
Hugging Face 推出 Quantization-Aware Healing (QAH) 方法,使压缩至 60B 参数并量化为 MXFP4 的 GPT-OSS 120B 模型在 9 项基准测试中的 7 项上超越其 bfloat16 全精度版本。该方法通过直接从原始未压缩模型进行知识蒸馏,解决了结构压缩后传统恢复手段的性能瓶颈,实现了更小、更便宜且更准确的部署效果。
Microsoft Research 推出深度学习 DFT 泛函 Skala 1.1,其训练数据量较前代增加 2.5 倍。该模型在 GMTKN55 基准测试的 55 个类别中夺得 32 项第一,加权平均误差为 2.8 kcal/mol。Skala 现已支持 CP2K,并正集成至 Psi4、FHI-aims、ORCA 和 VASP 等计算化学软件中。
Google Research 引入“知识画像”行为框架和 WikiProfile 基准,区分大语言模型中的事实编码与检索能力。研究发现 Gemini-3-Pro 和 GPT-5 等前沿模型的事实编码率高达 95–98%,但仍有 26–34% 的已编码事实无法直接检索,表明事实性错误的瓶颈已从知识获取转向知识利用。
推荐理由:原文提出知识画像框架并构建 WikiProfile 基准,揭示前沿模型事实性错误主要源于检索失败而非编码缺失,为优化模型知识利用率提供新视角。
Hugging Face 推出离线 Top-K Logits 缓存与融合分块 KL 损失技术,解决大模型知识蒸馏的高显存痛点。该方法避免同时加载教师与学生模型及构建全词表矩阵,将单步训练峰值显存从约 250GB 降至 128GB。这一优化使长上下文修复可在单张 GPU 上运行,显著降低了大规模实验的成本门槛。
DharmaOCR 通过领域专用训练,在巴西葡萄牙语识别任务中表现优于 Mistral OCR4 和 Unlimited-OCR。该模型采用监督微调与直接偏好优化(DPO)两阶段训练,集中参数资源于目标语言,从而在提取质量和推理稳定性上取得优势。
伯克利 AI 研究团队指出随着推理成本急剧下降,数据系统面临为智能体服务、作为智能体基底以及由智能体构建的三大新挑战。文章分析了智能体推测性查询带来的优化机会,探讨了支持多智能体协调的结构化记忆机制,并讨论了利用智能体从零合成可验证定制数据系统的可行性与难点。
Photoroom 团队公开了 PRX 模型系列第四部分,详述其预训练数据策略。核心做法是混合公共与内部数据集,利用 Qwen3-VL-8B 等 VLM 生成长且准确的描述,并通过分辨率和宽高比分桶将数据转换为 Mosaic Data Shards (MDS) 格式以支持分布式流式训练。
Goldfeder、LeCun等人在2026年发表《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》,结合优化理论与生物学证明通用性并非性能优势。在算力与数据有限约束下,针对特定任务的专业化系统比追求广泛覆盖的通用模型更具竞争力,实现了从“广度”向“适配度”的战略转移。
Hugging Face 推出 DiScoFormer,该模型通过单次前向传播即可同时估计数据分布的密度和分数,无需针对新分布重新训练。在 100 维数据上,其分数误差比最佳 KDE 低约 6.5 倍,密度误差降低超 37 倍,且能泛化至非高斯分布。这一预训练插件式估计器有望大幅降低生成建模及科学计算中的成本。
NVIDIA 推出开源库 NeMo AutoModel,作为 HuggingFace Transformers v5 的扩展,专门用于加速 Mixture-of-Experts (MoE) 模型的微调。
推荐理由:原文提供了基于 Transformers v5 的 MoE 模型微调加速方案,读者可据此了解如何通过单行代码修改获得显著的吞吐提升与显存节省。
Hugging Face 发布博客探讨参数高效微调(PEFT)技术,指出虽然 LoRA 占据主导地位,但其他技术在特定场景下表现更优。团队在 LLM 数学推理和图像生成任务上对超过 40 种 PEFT 技术进行了标准化基准测试,结果显示 OFT 在图像生成的相似度和显存占用上均优于 LoRA,而 BEFT 和 Lily 等变体在 LLM 任务的精度与内存权衡中也展现出竞争力。
Hugging Face 发布研究,显示在 DharmaOCR 模型上应用直接偏好优化(DPO)后,平均文本退化率降低 59.4%,最高达 87.6%。该方案利用模型自身失败输出构建训练信号,有效解决了监督微调(SFT)难以消除重复循环的局限。
Mistral AI 展示其在航空航天、汽车及能源等领域的物理 AI 研究成果。核心突破包括支持单 GPU 处理 140M 体积单元的 AB-UPT 模型,以及首个端到端深度学习代理 NeuralDEM。这些技术旨在加速工业工程中的 CFD 模拟与多物理场实时仿真。
AWS 解析基础模型全生命周期对算力、网络及存储的收敛需求,展示 P5/P6 实例集成 H100/H200/B200/B300 GPU 的技术架构。文中详列各代 GPU 的 BF16/FP8 Tensor 峰值吞吐、HBM 容量及带宽参数,并阐述 Slurm/Kubernetes 等开源栈在资源编排与可观测性中的分层作用。
Google Research 发布开源工具与数据集,赋能超 250,000 名研究人员。其 DeepVariant 等基因组学工具处理了 2.5 million 个体数据,NeuralGCM 支持大气建模,HAI-DEF 提供 MedGemma 等医疗基础模型。这些资源涵盖神经科学、地球建模及生物多样性等领域,旨在通过开放协作加速全球科学发现。
IBM 发布 Granite 4.1 系列大语言模型(3B、8B、30B),采用 Apache 2.0 许可证开源。该系列基于约 15T tokens 进行五阶段预训练,上下文窗口扩展至 512K,并通过监督微调和多阶段强化学习优化。其中 8B 稠密模型在指令遵循和工具调用等任务上表现匹敌甚至超越前代 32B MoE 模型,提供了可预测的延迟和更低成本的企业级解决方案。
推荐理由:原文详细拆解了从预训练到多阶段强化学习的全流程,展示了如何通过严格的数据工程让8B稠密模型在多项指标上匹敌32B MoE架构。
Google DeepMind 推出 Decoupled DiLoCo 架构,支持在低带宽下跨数据中心异步训练 LLM。该方案利用 Gemma 4 模型验证,通过隔离硬件故障提升系统韧性,并在 2-5 Gbps 网络下比传统同步方法快 20 倍以上完成 12B 参数模型训练。
Hugging Face 推出 QIMMA,这是首个整合开源、原生阿拉伯语内容、系统性质量验证、代码评估及公开推理输出的 LLM 排行榜。该基准包含超 52,000 个样本,利用 Qwen3-235B-A22B-Instruct 和 DeepSeek-V3-671B 进行多阶段自动化与人工审核,剔除了广泛使用的阿拉伯语基准中的系统性质量问题。
Google Research 推出 Simula,一种基于推理优先的无种子智能体框架,通过机制设计从第一性原理构建合成数据集。该方案利用 Gemini 2.5 Flash 作为教师模型、Gemma-3 4B 作为学生模型进行验证,将生成过程分解为全局/局部多样性、复杂化及质量检查四个可控轴。
Google Research 发布开源模型 MoGen,利用点云流匹配生成合成神经元以增强 PATHFINDER 训练数据。该方法使小鼠轴突重建错误率降低 4.4%,在完整小鼠脑尺度上相当于节省 157 人年的手动校对工作。
Hugging Face 发布 Ecom-RLVE,将 RLVE 框架扩展至多轮工具增强型电商对话场景。该方案提供 8 个可验证环境及 12 轴难度课程,通过算法奖励训练 Qwen 3 8B 模型完成商品发现、购物车构建等任务。
Google Research 发布 ConvApparel 数据集,包含超 4,000 段多轮人机对话,旨在量化 LLM 用户模拟器的真实性差距。该研究通过双代理协议收集数据,并建立涵盖统计对齐、拟人度评分及反事实验证的评估框架,以提升模拟器在复杂交互中的可信度。
OpenMed 构建端到端蛋白质 AI 流水线,通过 CodonRoBERTa-large-v2 实现低困惑度(4.10)的密码子优化。该模型在 55 GPU 小时内扩展至 25 个物种,总成本仅 $165。此开源方案填补了多物种条件化 mRNA 设计的空白,显著优于 ModernBERT。
Hugging Face 正式发布 TRL v1.0,标志着该库从研究代码转变为支持生产环境的稳定基础设施。新版本实现了超过 75 种后训练方法,采用“稳定核心+实验层”的双轨制以应对算法的快速迭代,并计划在未来引入异步 GRPO、更多蒸馏方法以及面向 Agent 的训练可解释性功能。
推荐理由:原文阐述了在快速变化的后训练领域维持库稳定性的设计哲学,并给出了异步GRPO等具体演进路线。
Hugging Face 联合 NVIDIA 发布了一套在单 GPU 上一天内微调领域专用嵌入模型的完整教程与开源配方。该流程利用 NeMo Data Designer 自动生成合成训练数据,结合硬负例挖掘和对比学习优化检索性能,并支持通过 ONNX/TensorRT 导出及 NVIDIA NIM 部署为 OpenAI 兼容 API。
推荐理由:原文提供了从文档生成到模型部署的完整六步流程及真实企业案例,读者可据此评估该方案在特定垂直领域的落地可行性。
Mistral AI 推出 Forge 系统,允许企业利用内部文档、代码库和运营记录等专有数据训练前沿级 AI 模型。该系统支持密集型和混合专家(MoE)架构,涵盖预训练、后训练及强化学习全流程,旨在通过让模型内化机构知识来提升智能体在复杂工作流中的可靠性与控制权。
Google Research 发布 Groundsource 方法,利用 Gemini 大模型从全球新闻中提取非结构化信息,构建包含 260 万条记录的城市山洪开放数据集。该方法通过分类、时间推理和空间定位技术处理 80 种语言的报道,经人工验证 82% 的数据具备实际分析价值,并已在 Google Flood Hub 中用于提供提前 24 小时的近全球城市山洪预报。
推荐理由:该研究利用 Gemini 从新闻中提取结构化洪水数据,解决了历史观测缺失问题,为灾害预测提供了新范式。
Hugging Face 调研了 16 个开源强化学习库,指出同步训练中推理耗时导致 GPU 闲置,主流方案是将推理与训练解耦并异步传输权重。Ray 主导编排,NCCL 广播为默认权重同步方式,LoRA 支持稀疏且分布式 MoE 成为新差异点。
Hugging Face Hub 正式推出 Storage Buckets,提供类似 S3 的非版本化对象存储,专门用于管理训练检查点、日志等频繁变动的中间文件。
推荐理由:原文给出了基于 Xet 的去重存储机制和 CLI/Python 集成入口,读者可以据此判断它如何优化中间产物的传输效率与成本。
Hugging Face 发布技术指南,介绍如何利用 Ulysses 序列并行(源自 Snowflake AI Research)解决大模型长序列训练的内存瓶颈。
推荐理由:原文详细解析了 Ulysses 序列并行原理,并提供了在 Hugging Face 生态中配置长上下文训练的具体代码与基准测试数据。
Google Research 推出 WAXAL,包含约1846小时ASR转录数据和565小时TTS高保真录音,覆盖27种撒哈拉以南非洲语言。该数据集采用 CC-BY-4.0 许可开源,由非洲学术与社区组织主导采集,旨在支持超1亿使用者的语音技术研发。
Google Research 推出 MapTrace,通过自动化流水线生成 200 万问答对以解决 MLLM 在地图路径追踪上的空间推理缺陷。该方案利用 Gemini 2.5 Pro 和 Imagen-4 构建含“Mask Critic”与“Path Critic”的合成数据管线,开源数据集旨在显式教授模型几何拓扑关系,弥补预训练模型缺乏物理世界导航规则的短板。