跳到正文
原文
Hugging Face Blog·· 2026-05-27精选AI 评分80

TRL 发布 Delta Weight Sync 方案以优化异步 RL 权重同步

Shipping a Trillion Parameters With a Hub Bucket: Delta Weight Sync in TRL

AI 导读

Hugging Face 在 TRL 中实现了 Delta Weight Sync 机制,通过仅传输变化的稀疏权重并将文件上传至 Hub Bucket,大幅降低异步强化学习中的带宽需求。在 Qwen3-0.6B 模型上,每步负载从 1.2 GB 降至 20-35 MB,且支持训练器与推理引擎在不同网络环境下解耦运行。

推荐理由

原文给出了基于稀疏权重同步的开源实现与实测数据,读者可以据此判断如何低成本构建跨地域异步强化学习训练架构。

来源:Hugging Face Blog · huggingface.co