Hugging Face Blog·· 2025-04-26精选AI 评分68
ServiceNow 开源 PipelineRL:支持飞行中权重更新的 LLM 强化学习实现
PipelineRL
AI 导读
ServiceNow Research 在 Hugging Face 博客宣布开源实验性强化学习实现 PipelineRL,旨在解决大规模 LLM RL 训练中推理吞吐量与在线数据收集之间的权衡问题。
推荐理由
原文开源了通过飞行中权重更新解决 RL 训练吞吐与数据新鲜度权衡的实现,并展示了在简化算法下达到竞争性基准结果的技术细节。
来源:Hugging Face Blog · huggingface.co