Hugging Face Blog·· 2026-06-03AI 评分45
Hugging Face 展示 DPO 在 OCR 任务中降低文本退化率的效果
Direct Preference Optimization Beyond Chatbots
AI 导读
Hugging Face 发布研究,显示在 DharmaOCR 模型上应用直接偏好优化(DPO)后,平均文本退化率降低 59.4%,最高达 87.6%。该方案利用模型自身失败输出构建训练信号,有效解决了监督微调(SFT)难以消除重复循环的局限。
来源:Hugging Face Blog · huggingface.co