Hugging Face Daily Papers·· 2 天前AI 评分41
通过位置选择性自蒸馏从语言反馈中训练 LLM 评判模型
Training LLM Judges from Language Feedback via Position-Selective Self-Distillation
AI 导读
研究提出位置选择性自蒸馏方法,利用自然语言反馈训练 LLM 评判模型。该方法基于教师与学生模型间的逐位置熵偏移进行位置掩码,保留熵偏移分布的低尾部分,从而提升分布外泛化能力。实验显示,自蒸馏评判模型在主观任务子类别上比 GRPO 等结果监督强化学习训练的评判模型高出 2-9 个百分点,在客观任务上保持竞争力。
来源:Hugging Face Daily Papers · arxiv.org