PLC-DPO:在噪声与模糊偏好优化中的后验标签校正
PLC-DPO: Posterior Label Correction in Noisy and Ambiguous Preference Optimization
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
针对 DPO 假设所有偏好标签可靠的问题,研究者提出 PLC-DPO,利用校准后的策略-参考模型 margin 作为在线证据,将每对样本的训练信号分流为干净、翻转或平局三类,主动校正监督方向与强度。在 57 个数据集-模型-基准组合中,PLC-DPO 对 DPO 的平均胜率达 60.5,优于次优方法的 55.5。该工作为 EMNLP 2026 Findings,代码已开源。
来源:Hugging Face Daily Papers · arxiv.org