跳到正文

#数据/训练

今日 0 条
11月7日周二
10月25日周三
10月24日周二
  1. Hugging Face Blog73

    Hugging Face 详解 RLHF with PPO 的实现细节及优化器差异

    Hugging Face 团队发布博客文章,详细解析了基于 PPO 的 RLHF(人类反馈强化学习)实现细节。该研究成功复现了 OpenAI 2019 年 lm-human-preferences 代码库的学习曲线,并整理了一份关键实施清单。

    推荐理由:原文通过复现 OpenAI 早期 RLHF 代码,揭示了 PyTorch 与 TensorFlow Adam 优化器在数值实现上的差异及其对模型训练稳定性的具体影响。

9月13日周三
  1. Hugging Face Blog45

    使用 PyTorch FSDP 微调 Llama 2 70B

    Hugging Face 演示如何利用 PyTorch FSDP、Transformers、Accelerate 和 TRL 微调 Llama 2 70B。通过仅在 rank 0 加载权重并广播至其他设备,解决了多 GPU 并行加载导致的 CPU 内存溢出问题。该方案在 2 节点 16 张 A100 GPU 环境下运行,显著降低了显存占用并提升了训练速度。

8月22日周二
8月8日周二
  1. Hugging Face Blog77

    Hugging Face 发布使用 DPO 微调 Llama 2 的实践指南

    Hugging Face 博客介绍了如何在 TRL 库中使用直接偏好优化(DPO)方法微调 Llama v2 7B 模型。文章详细演示了从监督微调(SFT)到 DPO 训练的全流程,包括数据格式准备、QLoRA 配置及关键超参数 beta 的设置,并提供了可复用的代码示例和最终模型链接。

    推荐理由:提供了在TRL库中使用DPO微调Llama 2的完整代码与流程,展示了如何绕过复杂RLHF步骤直接优化偏好数据。

8月2日周三
6月7日周三
5月24日周三
5月16日周二
4月27日周四
4月26日周三
4月12日周三
4月5日周三
3月27日周一
3月9日周四
  1. Hugging Face Blog82

    Hugging Face 发布 TRL 与 PEFT 集成指南:在 24GB GPU 上微调 20B LLM

    Hugging Face 正式发布了 trl 库与 peft 库的集成方案,使得用户能够在单张 24GB 消费级 GPU(如 NVIDIA 4090)上对 20B 参数的大语言模型进行基于强化学习的人类反馈(RLHF)微调。该方案通过结合 8-bit 量化加载、低秩适配器(LoRA)以及共享参考模型权重等技术,大幅降低了显存需求,并提供了从基础微调到情感导向 RL 训练的完整脚本示例。

    推荐理由:原文给出了在单张24GB消费级GPU上微调20B模型的具体步骤和代码示例,为资源受限环境下的RLHF实践提供了可复用的技术路径。

2月10日周五
1月26日周四
  1. Hugging Face Blog82

    Hugging Face 发布 diffusers 中 LoRA 用于 Stable Diffusion 高效微调的指南

    Hugging Face 在 diffusers 库中正式支持使用 LoRA 技术对 Stable Diffusion 进行高效微调。该方法通过冻结预训练权重并注入可训练层,使全量微调仅需 11 GB VRAM 即可运行,且生成的权重文件仅约 3 MB,比原始 UNet 模型小约一千倍。

    推荐理由:原文提供了在 diffusers 中使用 LoRA 进行 Stable Diffusion 微调的具体脚本和推理代码,展示了显著降低显存需求和模型文件大小的实际效果。

1月24日周二
  1. Hugging Face Blog43

    解析 ChatGPT 背后的 RLHF、IFT 与 CoT 等技术原理

    Hugging Face 梳理了 ChatGPT 成功的关键技术,包括 RLHF、SFT、IFT 和 CoT。文章对比了 LaMDA、BlenderBot 3、Sparrow、InstructGPT 及 Claude 等对话智能体在模型规模、训练数据及评估标准上的异同。重点阐释了指令微调(IFT)如何提升模型遵循指令能力,以及监督微调(SFT)在确保回复安全与有用性中的作用。

12月15日周四
  1. Hugging Face Blog37

    Hugging Face 🤗 Datasets 音频数据集加载与处理指南

    Hugging Face 开源库 🤗 Datasets 支持通过 `load_dataset` 函数一行代码下载并预处理音频数据。该工具集成 Hub 上77个语音识别及28个音频分类数据集,提供流式模式与实时预览功能。以 GigaSpeech 为例,用户可轻松加载从10小时到10,000小时的多种配置,自动完成数据解压、切分及特征提取。

12月9日周五
  1. Hugging Face Blog33

    Hugging Face 详解 RLHF:从预训练到奖励模型再到强化学习微调

    Hugging Face 解析 RLHF 流程,涵盖预训练语言模型、基于人类偏好训练奖励模型及强化学习微调三个核心步骤。该方法通过标量奖励将人类反馈转化为损失函数以优化模型,成功应用于 ChatGPT 等系统。文中对比了 OpenAI InstructGPT、Anthropic 及 DeepMind Gopher 在参数规模与数据生成策略上的差异。

12月2日周五
9月26日周一
9月8日周四
9月7日周三
  1. Hugging Face Blog31

    如何在 Megatron-LM 中训练语言模型

    Hugging Face 发布教程,指导在 NVIDIA GPU 上使用 Megatron-LM 框架训练 GPT2 模型并转换为 🤗 Transformers 格式。Megatron-LM 通过高效 DataLoader、Fused CUDA Kernels 及 Apex Fused AdamW 优化器提升训练速度。该流程涵盖环境搭建、CodeParrot 数据预处理、模型训练及转换步骤。

8月22日周一
8月5日周五
7月28日周四
7月16日周六
7月14日周四
  1. Hugging Face Blog45

    BLOOM 176B 模型训练技术解析

    Hugging Face 公布 176B 参数多语言模型 BLOOM 的训练工程细节。该模型基于 GPT3 架构,在 Jean Zay 超算上利用 384 张 NVIDIA A100 80GB GPU,通过 Megatron-DeepSpeed 框架耗时 3.5 个月完成训练。项目处理了涵盖 46 种语言的 350B tokens 数据集,实现了大规模分布式并行训练的技术突破。

6月28日周二
6月9日周四
5月23日周一
5月17日周二
5月2日周一
4月28日周四
  1. Hugging Face Blog26

    使用 Kili 和 HuggingFace AutoTrain 构建文本分类主动学习流程

    文章演示了结合 Kili 标注平台与 HuggingFace AutoTrain 构建文本分类的主动学习流程。以 Medium 应用商店约 40130 条用户评论为例,通过定义订阅、内容等类别进行数据清洗与模型训练。该方案利用 AutoTrain 自动化超参数优化及 SOTA Transformer 模型生成,实现高效的用户情感分析。

12月8日周三
  1. Hugging Face Blog42

    Hugging Face 从零训练 CodeParrot 🦜 指南

    Hugging Face 发布教程,指导用户从零开始训练名为 CodeParrot 的 Python 代码生成模型。该模型基于 GPT-2 large 架构(1.5B 参数),利用清洗后的 50GB GitHub Python 数据集进行训练。通过自定义 Tokenizer 和 🤗 Accelerate 库,开发者可复现类似 GitHub Copilot 的代码自动补全功能。

11月29日周一
10月25日周一
  1. Hugging Face Blog35

    Hugging Face 社区周项目:使用 10 亿训练对与 TPU v3-8 训练 SOTA 句子嵌入模型

    Hugging Face 在“用 10 亿训练对训练最佳句子嵌入模型”项目中开发了 state-of-the-art 句子嵌入模型。该项目利用 7 个 TPU v3-8 和 JAX/Flax 框架,采用对比学习及 Multiple Negative Ranking Loss 进行训练。通过优化批次大小、引入 hard negatives 及使用缩放余弦相似度,显著提升了模型性能。