跳到正文

#数据/训练

今日 0 条
2月2日周日
  1. Hugging Face Blog65

    Hugging Face 发布 Open-R1 项目进展:复现 DeepSeek-R1 训练管线与数据

    Hugging Face 更新 Open-R1 项目进展,旨在复现 DeepSeek-R1 缺失的训练管线和合成数据。团队已在 MATH-500 基准上验证评估结果,并将 GRPO 集成至 TRL v0.14 以支持并行训练。

    推荐理由:原文公开了复现 DeepSeek-R1 的训练管线与合成数据生成细节,提供了可参考的工程实现方案。

1月31日周五
1月28日周二
  1. Hugging Face Blog65

    Hugging Face 启动 Open-R1 项目以完全复现 DeepSeek-R1

    Hugging Face 宣布启动 Open-R1 项目,旨在系统性重建 DeepSeek-R1 的数据和训练流程。该项目计划通过蒸馏高质量推理数据集、复现纯强化学习管线以及展示多阶段训练方法,来填补官方未公开代码和数据集的空白,推动开源推理模型的发展。

    推荐理由:原文详细拆解了 DeepSeek-R1 的训练配方并规划了复现路径,为社区提供了构建开源推理模型的具体方法论和数据策略参考。

12月16日周一
12月10日周二
12月9日周一
12月3日周二
11月12日周二
11月4日周一
  1. Hugging Face Blog45

    Argilla 2.4 发布:无需代码即可在 Hub 构建微调与评估数据集

    Argilla 2.4 推出无代码功能,允许用户直接从 Hugging Face Hub 导入数据集并定义问题以收集人类反馈。该工具作为开源数据中心平台,简化了社区协作标注流程,支持通过 UI 实时配置字段与问题类型。此更新降低了非技术人员参与高质量 AI 数据集构建的门槛,适用于微调或评估场景。

10月24日周四
10月23日周三
  1. Hugging Face Blog38

    Hugging Face 发布 CinePile 2.0:通过对抗性精炼增强长视频问答数据集

    Hugging Face 推出 CinePile 2.0,采用新提出的“对抗性数据集精炼”方法显著优化长视频 QA 数据集。该版本旨在解决初版中部分问题无需视觉信息即可回答及存在退化项的局限,提升数据质量与难度。CinePile 1.0 曾包含约 30 万训练样本,其基准测试显示人类表现优于最佳商业视觉模型 25%。

10月16日周三
  1. Hugging Face Blog42

    Hugging Face 修复 transformers Trainer 梯度累积损失计算错误

    Hugging Face 修复了 transformers Trainer 中梯度累积导致损失计算与全批量训练不一致的问题。该缺陷源于默认损失函数未正确按非填充 token 总数归一化,现通过更新 ForCausalLMLoss 逻辑及新增自定义 loss_function API 解决。用户可通过从 main 分支安装获取修复,确保因果语言模型等任务在梯度累积下的数学等价性。

10月9日周三
10月5日周六
  1. Hugging Face Blog26

    Hugging Face 优化 Hub Parquet 存储去重效率

    Hugging Face Xet 团队针对 Hub 上超 2.2PB 的 Parquet 数据,测试基于字节级内容定义分块(CDC)的去重效果。实验显示追加操作可实现 99.1% 去重,但修改和删除因列头偏移及压缩导致去重率降至 89% 或更低。团队提出按 Key 哈希划分行组的新方案,以在保持压缩的同时提升跨版本去重效率。

9月23日周一
9月18日周三
  1. Hugging Face Blog63

    Hugging Face 详解如何将 LLM 微调至 1.58bit 极限量化

    Hugging Face 发布技术博客,介绍如何通过特定技巧将现有的 Llama3 8B 模型微调至 BitNet 架构支持的 1.58bit 极限量化水平。团队通过引入动态 lambda 值逐步应用量化以解决权重分布突变导致的性能损失,最终在仅使用 10B tokens 微调的情况下使模型在 MMLU 基准测试中超越 Llama 1 7B。

    推荐理由:原文详细拆解了将 Llama3 微调至 1.58bit 的量化技巧与动态 lambda 调度策略,为低精度模型部署提供了可复现的工程路径。

9月17日周二
  1. Hugging Face Blog68

    Hugging Face 推出 Datasets SQL Console

    Hugging Face Hub 为 Datasets 推出了新的 SQL Console 功能,允许用户直接在浏览器中通过 SQL 查询、过滤和发现数据集。该控制台由 DuckDB WASM 驱动,支持完整的 DuckDB 语法及正则、JSON 等内置函数,且无需任何服务器依赖。用户可将查询结果导出为 Parquet 文件或通过链接分享,目前内存限制约为 3GB,适用于大多数常规查询场景。

    推荐理由:官方介绍了基于 DuckDB WASM 的浏览器内 SQL 查询功能,无需后端即可直接筛选和转换数据集,适合需要快速处理 Parquet 数据的开发者。

8月27日周二
8月21日周三
8月6日周二
  1. Hugging Face Blog37

    Hugging Face 与 Albumentations AI 推出 TextImage 文档图像增强技术

    Hugging Face 联合 Albumentations AI 发布 TextImage 数据增强管线,专为视觉语言模型微调设计。该多模态方法通过随机插入、删除或交换文本并同步修复图像背景,在保留语义的同时生成合成训练数据。开发者可通过 `albumentations` 库调用,支持 IDL 和 PDFA 数据集以解决小样本下的 OCR 精度问题。

7月18日周四
7月11日周四
7月10日周三
7月8日周一
6月24日周一
  1. Hugging Face Blog53

    Florence-2 微调教程:在 DocVQA 数据集上实现视觉问答

    Hugging Face 发布教程展示如何微调 Microsoft 的 Florence-2 模型以支持 DocVQA 任务。通过冻结视觉编码器并在单张 A100 GPU 上使用 batch size 6 进行 7 个 epoch 的训练,验证集上的 Levenshtein 相似度从 0 提升至 57.0。该过程证明了小参数量视觉语言模型在受限资源下适配下游任务的可行性。

6月20日周四
6月13日周四
6月12日周三
6月5日周三
  1. Mistral AI53

    Mistral AI 发布模型定制服务

    Mistral AI 在 la Plateforme 上推出模型定制功能,提供开源微调 SDK、无服务器微调服务及自定义训练服务三种入口。开发者可使用 mistral-finetune 代码库基于 LoRA 范式在自有基础设施上微调开源模型,或通过 API 调用 Mistral 7B 和 Mistral Small 的托管微调服务以降低成本并提升效率。

3月20日周三
  1. Hugging Face Blog75

    Hugging Face 发布 Cosmopedia:用于预训练大语言模型的大规模合成数据生成指南

    Hugging Face 推出 Cosmopedia,这是一个包含超过 3000 万个文件和 250 亿 token 的开源合成数据集,旨在复现 Phi-1.5 的训练数据以用于从零开始预训练大语言模型。

    推荐理由:原文详细拆解了从提示词工程到大规模生成的完整技术栈,为复现 Phi 系列合成数据提供了可落地的开源方案。

3月15日周五
3月4日周一
2月16日周五
  1. Hugging Face Blog67

    Hugging Face 演示用开源 LLM 生成合成数据训练高效专用模型

    Hugging Face 发布教程展示如何利用开源 Mixtral-8x7B-Instruct-v0.1 模型生成合成数据,以微调 RoBERTa-base 等小型专用模型。

    推荐理由:通过金融情感分析案例演示了利用开源大模型生成合成数据并微调小模型的完整流程,提供了具体的成本与性能对比数据及可复用的代码仓库。

1月10日周三
  1. Hugging Face Blog78

    Hugging Face 介绍如何使用 Unsloth 将 LLM 微调速度提升 2 倍

    Hugging Face 博客介绍了社区开发的轻量级工具 Unsloth,该工具与 🤗 TRL 库完全兼容,可将大语言模型(LLM)的微调速度提升最高 2.7 倍,同时减少高达 74% 的显存使用量且精度零损失。

    推荐理由:原文提供了 Unsloth 与 TRL 集成的具体代码示例和基准测试数据,展示了在不损失精度的情况下显著降低显存占用并加速微调的方法。

1月2日周二
  1. Hugging Face Blog62

    Hugging Face 发布 SDXL Dreambooth LoRA 高级训练脚本与最佳实践指南

    Hugging Face 发布了结合 Pivotal Tuning 和 Prodigy 优化器的 SDXL Dreambooth LoRA 高级训练脚本,旨在通过少量图像实现高质量概念捕捉并降低计算资源需求。该指南详细解析了文本编码器学习率、自定义标题、Min-SNR Gamma 加权等关键技巧,并展示了在 diffusers 库中的具体代码实现及在不同场景下的实验对比结果。

    推荐理由:整合了Pivotal Tuning与Prodigy优化器等前沿技巧,提供了可直接复用的SDXL LoRA微调脚本及详细参数配置指南。

12月11日周一
  1. Hugging Face Blog55

    Hugging Face 详解混合专家模型(MoE)原理与工程实践

    Hugging Face 发布博客详细解析混合专家模型(MoE),涵盖其稀疏性机制、负载均衡策略及在 Transformer 中的应用。文章对比了 Switch Transformers 等经典工作,探讨了 MoE 在预训练效率、微调稳定性及显存占用方面的权衡,并介绍了专家并行、容量因子优化及量化蒸馏等工程落地技术。

11月9日周四