Hugging Face Blog·· 2026-06-03AI 评分32
超越聊天机器人:用模型自身失败样本做 DPO,文本退化率平均降低 59.4%
Direct Preference Optimization Beyond Chatbots
AI 导读
DharmaOCR 团队把 Direct Preference Optimization(DPO)用于结构化 OCR 而非聊天对齐,用模型自身失败输出构建偏好对,在全部测试的模型家族中都将文本退化率降低,平均降幅 59.4%,最高 87.6%(Nanonets-OCR2–3B 从 1.61% 降至 0.20%)。
来源:Hugging Face Blog · huggingface.co