跳到正文
Hugging Face Daily Papers·· 2026-08-25AI 评分30

超越模仿:按推理进展过滤 On-Policy 蒸馏(R2-OPD)

Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

针对 On-policy 蒸馏(OPD)中教师奖励与真实推理进展不一致的问题,研究者提出 R2-OPD,通过构建教师奖励与独立估计的进展奖励两种轨迹内排序,在两者不一致时选择性抑制蒸馏奖励。该方法在推理表现上持续优于标准 OPD。论文编号 arXiv:2608.19408。

来源:Hugging Face Daily Papers · arxiv.org