跳到正文
原文
Hugging Face Blog·· 2025-04-26精选AI 评分68

ServiceNow 开源 PipelineRL:支持飞行中权重更新的 LLM 强化学习实现

PipelineRL

AI 导读

ServiceNow Research 在 Hugging Face 博客宣布开源实验性强化学习实现 PipelineRL,旨在解决大规模 LLM RL 训练中推理吞吐量与在线数据收集之间的权衡问题。

推荐理由

原文开源了通过飞行中权重更新解决 RL 训练吞吐与数据新鲜度权衡的实现,并展示了在简化算法下达到竞争性基准结果的技术细节。

来源:Hugging Face Blog · huggingface.co