跳到正文
原文
Hugging Face Blog·· 2024-06-12精选AI 评分62

Hugging Face 在 TRL 中推出 RLOO Trainer 以优化在线 RLHF 训练

Putting RL back in RLHF

AI 导读

Hugging Face 在 TRL 库中引入了 RLOO (REINFORCE Leave One-Out) Trainer,作为 PPO 的替代方案用于在线 RLHF 训练。

推荐理由

原文提供了 RLOO 算法在 TRL 中的实现细节、显存节省数据及 bf16 精度下的数值稳定性问题,为在线 RLHF 训练提供了可复用的工程参考。

来源:Hugging Face Blog · huggingface.co