跳到正文

#数据/训练

今日 0 条
10月1日周四
  1. Hugging Face Blog52

    AllenAI 发布 Olmo-core 3:面向大规模 MoE 的开源训练基础设施

    AllenAI 发布 Olmo-core 3,这是一套专为扩展至万亿参数规模混合专家(MoE)模型设计的开源训练基础设施。该系统通过集成专家并行、流水线并行和分布式优化器等技术,在 NVIDIA B300 GPU 上实现了相比前代约 2.7 倍的训练吞吐量提升,并支持 MXFP8 低精度格式以进一步优化显存占用。

9月29日周二
  1. Microsoft Research60

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,这是一个结合生物学世界模型与交互式工具链的 AI 研究系统,旨在连接模型、科学工具、文献及研究人员。该系统在胰腺导管腺癌(PDAC)研究中应用,仅用一个周末即完成了从缩小化合物搜索空间到确定候选药物的过程,并验证了多个排名靠前的化合物能驱动肿瘤细胞状态转变。

    推荐理由:微软研究院推出Quine,通过多模态世界模型与实验闭环加速生物发现,并在胰腺癌研究中验证了化合物筛选效率。

9月24日周四
9月4日周五
  1. Google Research46

    Google Research 联合 HHMI Janelia 发布雄性果蝇完整连接组图谱

    Google Research 与 HHMI Janelia 等机构合作,在《Cell》发表迄今最大的雄性果蝇大脑及中枢神经系统完整连接组图谱。该图谱包含超过 16.6 万个神经元和 1.25 亿个突触连接,通过 Neuroglancer 工具提供可视化与下载。这一成果利用 AI 技术加速了从电子显微镜图像到 3D 神经重建的过程,为研究动物感知、刺激反应及神经修复提供了基础资源。

9月3日周四
  1. Hugging Face Blog61

    Hugging Face 发布使用 GRPO 微调 LFM2.5-350M 提升结构化输出的教程

    Hugging Face 发布教程,演示如何使用 TRL 库和 GRPO 算法微调 LFM2.5-350M 模型以改善结构化输出能力。该方案仅需约 500 个样本和 100 步训练,可在免费 Colab 或 Kaggle GPU 上运行,使模型在 IFStruct 基准测试中的得分从 22.6% 提升至 29.7%,显著缩小了与小参数模型和大模型之间的差距。

    推荐理由:展示了在免费 GPU 上通过少量步骤微调小模型以提升结构化输出合规性的完整流程与实测效果。

  2. Hugging Face Blog78

    使用 TRL 和 OpenEnv 训练编码模型绘制水彩画的开源复现指南

    作者基于 Hugging Face 平台完整复现了通过强化学习训练大语言模型编写 JavaScript 代码以生成水彩画的过程,并开源了所有训练脚本、环境和数据集。文章详细解析了结合 HPSv3 评分与 Qwen3-VL-30B-A3B-Instruct 视觉判断器的奖励机制设计,对比了三种不同权重配置的实验结果,展示了如何利用人工筛选的图像池引导模型学习特定审美风格。

    推荐理由:完整公开了基于TRL和OpenEnv的强化学习训练代码、环境配置及三种奖励混合策略的实验对比,为复现美学偏好模型提供了可迁移的工程参考。

8月26日周三
  1. Hugging Face Blog75

    Sentence Transformers 多向量嵌入模型微调教程

    Sentence Transformers v6.0 引入 MultiVectorEncoder 以支持 ColBERT 风格的后期交互检索,本文详解其微调流程。作者展示了如何在单张 RTX 3090 上通过 14.5 小时训练出超越通用模型的医疗领域检索器,并提供了从数据加载、损失函数选择到索引优化的完整代码示例。

    推荐理由:原文给出了多向量模型微调的完整代码与实测对比,读者可据此在单卡上复现针对特定领域的检索增强方案。

8月25日周二
  1. Hugging Face Blog40

    Hugging Face 提出 Quantization-Aware Healing:GPT-OSS 4-bit 模型性能超越全精度原版

    Hugging Face 推出 Quantization-Aware Healing (QAH) 方法,使压缩至 60B 参数并量化为 MXFP4 的 GPT-OSS 120B 模型在 9 项基准测试中的 7 项上超越其 bfloat16 全精度版本。该方法通过直接从原始未压缩模型进行知识蒸馏,解决了结构压缩后传统恢复手段的性能瓶颈,实现了更小、更便宜且更准确的部署效果。

8月21日周五
8月12日周三
  1. Google Research60

    Google Research 提出知识画像框架:检索是参数化事实性的瓶颈

    Google Research 引入“知识画像”行为框架和 WikiProfile 基准,区分大语言模型中的事实编码与检索能力。研究发现 Gemini-3-Pro 和 GPT-5 等前沿模型的事实编码率高达 95–98%,但仍有 26–34% 的已编码事实无法直接检索,表明事实性错误的瓶颈已从知识获取转向知识利用。

    推荐理由:原文提出知识画像框架并构建 WikiProfile 基准,揭示前沿模型事实性错误主要源于检索失败而非编码缺失,为优化模型知识利用率提供新视角。

8月10日周一
  1. Hugging Face Blog42

    Hugging Face 提出高效知识蒸馏方案,大幅降低 LLM 训练显存需求

    Hugging Face 推出离线 Top-K Logits 缓存与融合分块 KL 损失技术,解决大模型知识蒸馏的高显存痛点。该方法避免同时加载教师与学生模型及构建全词表矩阵,将单步训练峰值显存从约 250GB 降至 128GB。这一优化使长上下文修复可在单张 GPU 上运行,显著降低了大规模实验的成本门槛。

7月16日周四
7月7日周二
  1. Berkeley AI Research53

    Berkeley AI Research 探讨智能体时代数据系统的三大挑战与机遇

    伯克利 AI 研究团队指出随着推理成本急剧下降,数据系统面临为智能体服务、作为智能体基底以及由智能体构建的三大新挑战。文章分析了智能体推测性查询带来的优化机会,探讨了支持多智能体协调的结构化记忆机制,并讨论了利用智能体从零合成可验证定制数据系统的可行性与难点。

7月6日周一
6月30日周二
  1. Hugging Face Blog41

    为何专业化是必然:Goldfeder等2026论文论证AI专用优于通用

    Goldfeder、LeCun等人在2026年发表《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》,结合优化理论与生物学证明通用性并非性能优势。在算力与数据有限约束下,针对特定任务的专业化系统比追求广泛覆盖的通用模型更具竞争力,实现了从“广度”向“适配度”的战略转移。

  2. Hugging Face Blog32

    DiScoFormer:单 Transformer 同时估计密度与分数

    Hugging Face 推出 DiScoFormer,该模型通过单次前向传播即可同时估计数据分布的密度和分数,无需针对新分布重新训练。在 100 维数据上,其分数误差比最佳 KDE 低约 6.5 倍,密度误差降低超 37 倍,且能泛化至非高斯分布。这一预训练插件式估计器有望大幅降低生成建模及科学计算中的成本。

6月25日周四
6月18日周四
  1. Hugging Face Blog58

    Hugging Face 解析 PEFT 技术:LoRA 并非微调的最优默认选择

    Hugging Face 发布博客探讨参数高效微调(PEFT)技术,指出虽然 LoRA 占据主导地位,但其他技术在特定场景下表现更优。团队在 LLM 数学推理和图像生成任务上对超过 40 种 PEFT 技术进行了标准化基准测试,结果显示 OFT 在图像生成的相似度和显存占用上均优于 LoRA,而 BEFT 和 Lily 等变体在 LLM 任务的精度与内存权衡中也展现出竞争力。

6月3日周三
5月27日周三
5月12日周二
5月2日周六
  1. Google Research33

    Google Research 通过全球合作与开放资源推动科学影响

    Google Research 发布开源工具与数据集,赋能超 250,000 名研究人员。其 DeepVariant 等基因组学工具处理了 2.5 million 个体数据,NeuralGCM 支持大气建模,HAI-DEF 提供 MedGemma 等医疗基础模型。这些资源涵盖神经科学、地球建模及生物多样性等领域,旨在通过开放协作加速全球科学发现。

4月29日周三
  1. Hugging Face Blog70

    IBM Granite 4.1 LLMs 技术详解:构建过程与性能表现

    IBM 发布 Granite 4.1 系列大语言模型(3B、8B、30B),采用 Apache 2.0 许可证开源。该系列基于约 15T tokens 进行五阶段预训练,上下文窗口扩展至 512K,并通过监督微调和多阶段强化学习优化。其中 8B 稠密模型在指令遵循和工具调用等任务上表现匹敌甚至超越前代 32B MoE 模型,提供了可预测的延迟和更低成本的企业级解决方案。

    推荐理由:原文详细拆解了从预训练到多阶段强化学习的全流程,展示了如何通过严格的数据工程让8B稠密模型在多项指标上匹敌32B MoE架构。

4月22日周三
4月21日周二
  1. Hugging Face Blog30

    Hugging Face 发布 QIMMA:首个通过质量验证的阿拉伯语 LLM 排行榜

    Hugging Face 推出 QIMMA,这是首个整合开源、原生阿拉伯语内容、系统性质量验证、代码评估及公开推理输出的 LLM 排行榜。该基准包含超 52,000 个样本,利用 Qwen3-235B-A22B-Instruct 和 DeepSeek-V3-671B 进行多阶段自动化与人工审核,剔除了广泛使用的阿拉伯语基准中的系统性质量问题。

4月16日周四
4月9日周四
3月31日周二
  1. Hugging Face Blog78

    Hugging Face 发布 TRL v1.0:面向动态后训练领域的稳定库

    Hugging Face 正式发布 TRL v1.0,标志着该库从研究代码转变为支持生产环境的稳定基础设施。新版本实现了超过 75 种后训练方法,采用“稳定核心+实验层”的双轨制以应对算法的快速迭代,并计划在未来引入异步 GRPO、更多蒸馏方法以及面向 Agent 的训练可解释性功能。

    推荐理由:原文阐述了在快速变化的后训练领域维持库稳定性的设计哲学,并给出了异步GRPO等具体演进路线。

3月21日周六
  1. Hugging Face Blog73

    Hugging Face 发布一天内构建领域专用嵌入模型的教程

    Hugging Face 联合 NVIDIA 发布了一套在单 GPU 上一天内微调领域专用嵌入模型的完整教程与开源配方。该流程利用 NeMo Data Designer 自动生成合成训练数据,结合硬负例挖掘和对比学习优化检索性能,并支持通过 ONNX/TensorRT 导出及 NVIDIA NIM 部署为 OpenAI 兼容 API。

    推荐理由:原文提供了从文档生成到模型部署的完整六步流程及真实企业案例,读者可据此评估该方案在特定垂直领域的落地可行性。

3月18日周三
3月12日周四
  1. Google Research70

    Google Research 推出 Groundsource:用 Gemini 将新闻报道转化为洪水历史数据

    Google Research 发布 Groundsource 方法,利用 Gemini 大模型从全球新闻中提取非结构化信息,构建包含 260 万条记录的城市山洪开放数据集。该方法通过分类、时间推理和空间定位技术处理 80 种语言的报道,经人工验证 82% 的数据具备实际分析价值,并已在 Google Flood Hub 中用于提供提前 24 小时的近全球城市山洪预报。

    推荐理由:该研究利用 Gemini 从新闻中提取结构化洪水数据,解决了历史观测缺失问题,为灾害预测提供了新范式。

3月10日周二
3月9日周一
3月7日周六
2月18日周三
  1. Google Research42

    Google Research 提出 MapTrace:利用合成数据提升多模态大模型地图路径追踪能力

    Google Research 推出 MapTrace,通过自动化流水线生成 200 万问答对以解决 MLLM 在地图路径追踪上的空间推理缺陷。该方案利用 Gemini 2.5 Pro 和 Imagen-4 构建含“Mask Critic”与“Path Critic”的合成数据管线,开源数据集旨在显式教授模型几何拓扑关系,弥补预训练模型缺乏物理世界导航规则的短板。