Google Research 提出 Sequential Attention:通过序列注意力机制优化模型特征选择
Google Research 推出 Sequential Attention,利用贪心选择与注意力评分在单次训练中实现自适应子集选择。该方法解决了特征选择的 NP-hard 难题,在多个神经网络基准测试中达到 SOTA 效果,显著降低训练开销并提升模型效率与可解释性。
Google Research 推出 Sequential Attention,利用贪心选择与注意力评分在单次训练中实现自适应子集选择。该方法解决了特征选择的 NP-hard 难题,在多个神经网络基准测试中达到 SOTA 效果,显著降低训练开销并提升模型效率与可解释性。
Google Research 发布 ATLAS,基于 774 次训练、10M–8B 参数模型及 400+ 种语言数据,提出自适应迁移缩放定律以优化多语言预训练。该研究量化了语言间协同效应,指出支持两倍语言数量需将模型规模扩大 1.18 倍、数据量增加 1.66 倍。ATLAS 为构建者提供了平衡语言混合与模型效率的数据驱动指南,并在 ICLR 2026 展示。
Google Research 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,通过平衡数据多样性与效用解决大规模数据集子集选择难题。该算法采用双准则贪心策略近似求解最大独立集问题,在图像分类等任务中超越 SOTA 基准,并提供解质量的数学保证。
Google Research 证实通过 Android Auto 收集的急刹车事件(HBE)与道路碰撞率呈显著正相关,可作为交通安全评估的领先指标。分析显示 HBE 数据密度是碰撞报告的 18 倍,能填补稀疏历史数据的空白并实时识别高风险路段。该发现支持将连接车辆数据整合至 Google Maps Platform 的道路管理洞察中,以替代传统滞后的事故统计进行网络级安全评估。
Google Research 在 Science Advances 发表新论文,介绍其混合大气模型 NeuralGCM 如何通过直接基于卫星降水观测数据进行训练,从而改进长期全球降水模拟。该模型在 280 km 分辨率下,相比传统物理模型,在平均降水、极端降水(特别是前 0.1% 降雨量)及日循环再现方面均取得显著提升,误差降低约 40%。
Google Research 推出 Titans 架构及 MIRAS 理论框架,结合 RNN 速度与 Transformer 精度实现测试时记忆。Titans 利用“惊讶度”指标动态更新参数,通过动量机制和自适应权重衰减管理长序列信息。MIRAS 将序列建模统一为关联内存模块,突破均方误差范式限制,支持实时适应无需离线重训练。
密歇根州立大学团队利用 AlphaFold 预测光合作用关键酶 GLYK 的三维结构,发现高温下其柔性环易失稳。研究人员借鉴嗜热藻类特征构建混合酶,成功使该酶在 65 °C 高温下保持稳定,为培育耐热作物提供新路径。
Hugging Face 推出 `hf-llm-trainer` 技能,使 Claude Code、Codex 和 Gemini CLI 等编码智能体能通过自然语言指令自动执行大语言模型的微调任务。
推荐理由:原文展示了通过自然语言指令让编码智能体完成从硬件选择到模型部署的全流程微调,提供了可复用的技能包配置与成本估算方法。
Hugging Face TRL 正式集成 RapidFire AI,通过自适应分块并发训练将微调实验吞吐量提升约 16–24 倍。用户可使用 RFSFTConfig 等零代码替换配置,在单 GPU 上并发比较多个 LLM 微调方案。该工具提供实时仪表盘与交互式控制操作,支持动态停止、克隆及修改运行中的任务以优化资源利用。
ServiceNow AI 团队发布 Apriel-H1 系列模型,成功将 15B 全注意力推理模型蒸馏为 Mamba 混合架构,在保持推理质量的同时实现 2.1 倍吞吐量提升。
推荐理由:揭示了蒸馏推理模型时选择高质量推理轨迹而非预训练数据的关键洞察,并提供了可复现的分阶段混合架构转换方法。
Google Research 发布 JAX-Privacy 1.0,基于 JAX 构建模块化差分隐私训练与审计工具包。该版本集成最新研究进展,支持 DP-SGD、DP-FTRL 及矩阵分解等算法,利用 JAX 原生并行特性实现大规模模型的高效私有训练。
Hugging Face 对 `datasets` 库的流式加载功能进行了底层重构,实现了启动请求减少 100 倍、数据解析速度提升 10 倍以及样本吞吐量翻倍。
推荐理由:Hugging Face 优化了 datasets 库的流式加载后端,通过减少请求风暴和引入预取机制,使大规模训练无需下载即可达到接近本地 SSD 的速度。
Hugging Face 联合 NVIDIA 推出首个开源印度人物合成数据集 Nemotron-Personas-India,采用 CC BY 4.0 许可。该数据集包含 2100 万个人物画像和 77 亿 token,覆盖英语及印地语(天城文与拉丁字母),基于 2011 年人口普查数据构建以反映真实分布。
NVIDIA 发布了 Nemotron-Personas-Japan,这是一个包含600万条记录的开放合成数据集,旨在为日本主权AI开发提供高质量训练数据。该数据集基于CC BY 4.0许可证,利用NeMo Data Designer生成,涵盖1500多种职业类别和95万个独特姓名,完全由人工合成以保护隐私。
Hugging Face 推出 SyGra,这是一款专为大语言模型(LLM)和小语言模型(SLM)设计的一站式低代码/无代码数据构建框架。SyGra 支持 vLLM、Hugging Face TGI、Triton 和 Ollama 等多种推理后端,可简化从 Q&A 生成到 DPO 对齐等复杂数据集的创建与转换流程。该框架旨在通过自动化数据处理减少工程负担,加速模型对齐并提升数据质量。
Together AI 宣布新功能,允许用户直接通过其基础设施对 Hugging Face Hub 上的任意兼容 LLM 进行微调。开发者只需指定基础模板和自定义模型参数,即可在几分钟内启动训练任务,并将微调后的模型自动上传回 Hub 或用于推理部署。该集成旨在降低传统微调的复杂度和成本,加速团队基于开源社区模型进行领域适配和迭代优化的速度。
推荐理由:Together AI 与 Hugging Face Hub 打通微调流程,开发者可直接调用平台基础设施定制任意兼容模型并回传社区。
Hugging Face 推出 Jupyter Agent 项目,旨在通过构建高质量训练数据和优化代理脚手架,提升小型语言模型在数据科学任务中的表现。团队利用 Kaggle Notebook 数据集经过多阶段清洗和合成生成约 51k 条轨迹,对 Qwen3-4B 进行全参数微调,使其在 DABStep 基准测试的简单任务上准确率提升至 75%。
推荐理由:原文公开了从数据清洗到微调的完整流水线及代码,展示了小模型在特定脚手架下性能提升的具体路径。
Hugging Face 推出 mmBERT,这是首个在性能上超越 XLM-R 的多语言编码器模型。该模型基于 ModernBERT 架构,使用超过 3T tokens 和 1800+ 种语言数据训练,包含 110M 参数的 base 版本。mmBERT 通过三阶段渐进式训练策略,显著提升了低资源语言的学习效率与多语言理解能力。
SandboxAQ 发布并开源 SAIR 数据集,包含 524 万个经 PoseBusters 验证的 AI 生成蛋白-配体 3D 结构及 IC₅₀ 标签。该数据在 Hugging Face 以 CC BY 4.0 协议免费开放,覆盖超 40% PDB 中无实验结构的“暗”靶点。
NVIDIA 发布包含法语、西班牙语等五种语言的 6 Million Multilingual Reasoning Dataset,并推出基于 Hybrid Transformer–Mamba 架构的 Nemotron Nano 2 9B 模型。该模型支持可配置 thinking budget,token 生成速度最高提升 6×,推理成本降低 60%,权重已在 Hugging Face 开源。
Hugging Face 开源 Kimina-Prover-RL 训练管线,基于 DeepSeek-R1 范式与 Verl 框架实现 Lean 4 定理证明。配套发布的 AI-MO/Kimina-Prover-RL-1.7B 在 MiniF2F 基准 Pass@32 达 76.63%,0.6B 版本达 71.30%,均创同尺寸开源模型新纪录。
Hugging Face 发布 Accelerate 和 Axolotl 的多 GPU 训练指南,介绍如何组合数据并行、张量并行等策略以优化大规模模型训练。文章详解了混合分片数据并行(HSDP)及 FSDP+TP 等 ND 并行模式的原理、配置代码及内存通信权衡技巧。
Hugging Face TRL 库新增对视觉语言模型(VLM)的多项对齐算法支持,包括混合偏好优化(MPO)、组相对策略优化(GRPO)和组序列策略优化(GSPO)。官方提供了相应的训练脚本、Notebook 示例以及 vLLM 集成方案,并实现了原生的监督微调(SFT)支持,帮助开发者更高效地进行多模态模型的后训练与对齐。
推荐理由:原文提供了在 TRL 中实现 VLM 对齐的具体代码配置与脚本,读者可直接复用这些方法优化多模态模型性能。
Hugging Face 博客介绍了 Apache Arrow 新推出的 Parquet Content-Defined Chunking (CDC) 特性,该特性现已支持 PyArrow 和 Pandas,旨在配合 Hugging Face 的 Xet 存储层实现更高效的 Parquet 文件去重。
Mistral AI 联合 Carbone 4 完成业界首个大语言模型全生命周期环境影响分析,披露 Mistral Large 2 训练产生 20,4 ktCO₂e、281 000 m³ 水耗及 660 kg Sb eq 资源消耗。
Arc Institute 发起 Virtual Cell Challenge,要求训练模型预测 CRISPR 基因沉默对细胞的影响。Arc 提供约 30 万单细胞 RNA 测序数据作为基准,并开源了基于 Transformer 架构的 STATE 模型(含 State Transition 和 State Embedding 组件)供参赛者参考。
Hugging Face 针对 nanoVLM 项目提出五阶段多模态数据管道优化方案,旨在解决 GPU 空闲与填充浪费问题。通过引入背包算法(Knapsack)进行智能打包并采用 Iterable Dataset,该方案显著减少无效 Token 填充,提升训练效率。
Hugging Face 联合发起 NeurIPS 2025 E2LM Competition,旨在构建捕捉大语言模型早期训练阶段科学知识的基准。比赛基于 lm-evaluation-harness,提供 0.5B、1B 和 3B 参数模型检查点供信号质量评分,隐藏部分数据以防过拟合。冠军奖金为 6,000 USD,结果将于 2025 年 11 月 4 日公布。
Hugging Face 发布指南,演示如何使用 diffusers 库通过 QLoRA 在单张 GPU(峰值显存约 9GB)上微调 FLUX.1-dev 模型。
推荐理由:原文提供了在消费级显卡上微调 FLUX.1-dev 的完整代码与显存优化策略,读者可据此复现低资源环境下的风格迁移训练。
用户在使用 Qwen2.5-0.5B-Instruct、DeepSpeed ZeRO3 和 bf16 精度测试 Liger GRPO loss 时,遭遇 shape mismatch 错误。
LeRobot 正通过简化录制与上传流程,推动 Hugging Face Hub 上社区贡献数据集快速增长,旨在构建机器人领域的“ImageNet”。目前 So100 和 Koch 机械臂数据占主导,涵盖抽屉操作、下棋等多样化任务。该举措致力于解决 VLA 模型泛化能力受限于数据多样性的问题,降低硬件门槛以实现更广泛的数据共享。
TNG 基于 olmOCR-7B-0225-preview 微调出能忠实提取文档页眉页脚信息的 OCR 引擎,解决了原模型忽略关键业务数据的问题。团队利用 Qwen2.5-VL-72B-Instruct 生成 8,000 份含完整结构的数据集进行训练,在保留表格解析能力的同时实现了全量信息抽取。该微调模型已在 Hugging Face 开源。
Hugging Face 宣布将首个模型和数据集仓库从 LFS 迁移至 Xet 存储,标志着 Xet 正式在 Hub 上线。Xet 采用内容定义分块技术实现字节级去重,显著提升了大文件传输效率,例如内部数据库上传时间从 13 分钟缩短至十分之一秒。用户可通过加入等待列表启用新存储,未来 huggingface_hub 将自动集成 hf_xet 包以支持无缝升级。
推荐理由:官方详述了从 LFS 迁移至 Xet 存储的工程实践与性能优化,为开发者提供了理解底层架构演进及获取新存储权益的参考。
Hugging Face 联合 IISc/ARTPARK 开放 Vaani 数据集,助力全球开发者构建覆盖印度 54 种语言的 AI 模型。该多模态数据集已开源 Phase 1(80 个地区),包含 790 小时转录音频及 70K 图像,支持语音识别、代码切换 ASR 及多模态 LLM 增强等任务。
Hugging Face 推出开源视频数据集脚本,结合 video2dataset 覆盖小规模与大规模场景。该三阶段流水线利用 yt-dlp、Florence-2 及 Qwen2.5 等模型进行下载、过滤与标注。社区已基于此微调 CogVideoX-5B 实现 Crush 等特效。
Open R1 项目发布 OpenR1-Math-220k 大规模数学推理数据集,该数据集在 512 块 H100 GPU 上本地生成,包含经过 Math Verify 和 Llama3.3-70B-Instruct 双重验证的 220k 条正确推理轨迹。
推荐理由:原文公开了基于本地算力生成的大规模数学推理数据集及过滤流程,并展示了通过微调复现 DeepSeek R1 蒸馏效果的具体实验数据。
Hugging Face 更新 Open-R1 项目进展,旨在复现 DeepSeek-R1 缺失的训练管线和合成数据。团队已在 MATH-500 基准上验证评估结果,并将 GRPO 集成至 TRL v0.14 以支持并行训练。
推荐理由:原文公开了复现 DeepSeek-R1 的训练管线与合成数据生成细节,提供了可参考的工程实现方案。
Philipp Schmid发布教程,利用Group Relative Policy Optimization (GRPO) 算法和 Countdown Game 任务,成功复现了 DeepSeek R1 的“aha moment”。
推荐理由:原文提供了基于GRPO和Countdown游戏复现R1推理能力的完整代码与训练配置,展示了在有限算力下实现模型自我验证的具体路径。
Hugging Face 宣布启动 Open-R1 项目,旨在系统性重建 DeepSeek-R1 的数据和训练流程。该项目计划通过蒸馏高质量推理数据集、复现纯强化学习管线以及展示多阶段训练方法,来填补官方未公开代码和数据集的空白,推动开源推理模型的发展。
推荐理由:原文详细拆解了 DeepSeek-R1 的训练配方并规划了复现路径,为社区提供了构建开源推理模型的具体方法论和数据策略参考。
Hugging Face 发布 Synthetic Data Generator,这是一款基于 LLM 的无代码应用,允许用户通过自然语言描述在几分钟内创建自定义数据集。