跳到正文
原文
Hugging Face Blog·· 2024-01-18AI 评分45

Hugging Face 评测 DPO、IPO 与 KTO 三种 LLM 偏好优化方法

Preference Tuning LLMs with Direct Preference Optimization Methods

AI 导读

Hugging Face 在两个 7B 模型上实证评估了 DPO、IPO 和 KTO 三种无需强化学习的对齐算法。修正后的实验显示,在配对偏好设置下 IPO 表现与 DPO 相当且优于 KTO。关键超参数 β 的调优对实现最佳性能至关重要。

来源:Hugging Face Blog · huggingface.co