跳到正文
原文
Hugging Face Blog·· 2026-03-31精选AI 评分78

Hugging Face 发布 TRL v1.0:面向动态后训练领域的稳定库

TRL v1.0: Post-Training Library Built to Move with the Field

AI 导读

Hugging Face 正式发布 TRL v1.0,标志着该库从研究代码转变为支持生产环境的稳定基础设施。新版本实现了超过 75 种后训练方法,采用“稳定核心+实验层”的双轨制以应对算法的快速迭代,并计划在未来引入异步 GRPO、更多蒸馏方法以及面向 Agent 的训练可解释性功能。

推荐理由

原文阐述了在快速变化的后训练领域维持库稳定性的设计哲学,并给出了异步GRPO等具体演进路线。

来源:Hugging Face Blog · huggingface.co