跳到正文
原文
Hugging Face Blog·· 2026-06-03AI 评分45

Hugging Face 展示 DPO 在 OCR 任务中降低文本退化率的效果

Direct Preference Optimization Beyond Chatbots

AI 导读

Hugging Face 发布研究,显示在 DharmaOCR 模型上应用直接偏好优化(DPO)后,平均文本退化率降低 59.4%,最高达 87.6%。该方案利用模型自身失败输出构建训练信号,有效解决了监督微调(SFT)难以消除重复循环的局限。

来源:Hugging Face Blog · huggingface.co