跳到正文
Hugging Face Daily Papers·· 25 天前AI 评分38

Negative Self-Distillation:让 LLM 通过避开缺陷来学习推理

Negative Self-Distillation: Learning to Reason by Avoiding Flaws

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

针对 On-Policy Self-Distillation(OPSD)在复杂推理任务上会抑制模型不确定性表达、惩罚探索与自我纠错行为的问题,研究者提出 Negative Self-Distillation(NSD)框架,让模型自行生成问题特定的负面条件(如扮演"粗心推理者"),并将学生分布推离这一自生成负面教师,而非模仿特权解答。

来源:Hugging Face Daily Papers · arxiv.org