跳到正文
Hugging Face Blog·· 2026-06-03AI 评分38

超越聊天机器人:用模型自身失败样本做 DPO,文本退化率最高降 87.6%

Direct Preference Optimization Beyond Chatbots

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

DharmaOCR 团队将 Direct Preference Optimization(DPO)用于结构化 OCR 任务,把正确转录设为 chosen、重复退化循环设为 rejected,在 SFT 之后追加第二阶段训练,使所有测试模型家族的文本退化率平均下降 59.4%,最高降幅达 87.6%(Nanonets-OCR2–3B 从 1.61% 降至 0.20%)。

来源:Hugging Face Blog · huggingface.co