跳到正文
原文
Hugging Face Blog·· 2026-01-27AI 评分42

GPT-OSS 智能体强化学习训练实践回顾

Unlocking Agentic RL Training for GPT-OSS: A Practical Retrospective

AI 导读

Hugging Face 团队验证了 GPT-OSS 在智能体强化学习中的适用性,指出其此前仅用于无工具调用的微调。实验发现 MoE 架构下的双前向传播导致对数概率不匹配,引发 KL 散度爆炸。通过修复 PPO 在线策略完整性,该方案成功支持 GPT-OSS-20B 及 120B 模型进行多步交互训练。

来源:Hugging Face Blog · huggingface.co