Hugging Face Blog·· 2024-06-12精选AI 评分62
Hugging Face 在 TRL 中推出 RLOO Trainer 以优化在线 RLHF 训练
Putting RL back in RLHF
AI 导读
Hugging Face 在 TRL 库中引入了 RLOO (REINFORCE Leave One-Out) Trainer,作为 PPO 的替代方案用于在线 RLHF 训练。
推荐理由
原文提供了 RLOO 算法在 TRL 中的实现细节、显存节省数据及 bf16 精度下的数值稳定性问题,为在线 RLHF 训练提供了可复用的工程参考。
来源:Hugging Face Blog · huggingface.co