跳到正文
Hugging Face Daily Papers·· 2026-08-31AI 评分31

CRPO:跨语言排序偏好优化,用英文偏好数据提升多语言对齐

Language Chain in Alignment: Cross-lingual Ranking Preference Optimization

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者提出跨语言排序偏好优化框架 CRPO,利用英语偏好知识提升目标语言的偏好对齐,在目标语言与英语的平行偏好对上构建层次结构,联合优化语内与语间偏好。基于 LambdaLoss,CRPO 用多候选回答间的相对排序信号替代二元比较优化。在五种不同资源规模语言上的实验显示,CRPO 在指令遵循和知识利用上均持续优于标准方法,并显著提升奖励边际与理想回答的对数概率。代码已开源。

来源:Hugging Face Daily Papers · arxiv.org