Hugging Face Blog·· 2025-08-07精选AI 评分62
TRL 新增视觉语言模型对齐支持:涵盖 MPO、GRPO 及 GSPO 等方法
Vision Language Model Alignment in TRL ⚡️
AI 导读
Hugging Face TRL 库新增对视觉语言模型(VLM)的多项对齐算法支持,包括混合偏好优化(MPO)、组相对策略优化(GRPO)和组序列策略优化(GSPO)。官方提供了相应的训练脚本、Notebook 示例以及 vLLM 集成方案,并实现了原生的监督微调(SFT)支持,帮助开发者更高效地进行多模态模型的后训练与对齐。
推荐理由
原文提供了在 TRL 中实现 VLM 对齐的具体代码配置与脚本,读者可直接复用这些方法优化多模态模型性能。
来源:Hugging Face Blog · huggingface.co