RISE:通过自外推策略蒸馏实现递归自我改进
RISE: Recursive Improvement via Self-Extrapolating Policy Distillation
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
RISE 提出一种无需外部教师模型的策略蒸馏方法,通过从模型自身 RLVR 训练轨迹中构造合成教师,将稀疏的结果奖励参数更新转化为密集的 token 级监督目标。该方法在数学推理、多领域 STEM、代码生成和多轮智能体任务中均优于纯 RLVR 训练和在线自蒸馏。由于教师模型随学生模型每轮迭代更新,蒸馏成为递归改进机制而非一次性压缩步骤。
来源:Hugging Face Daily Papers · arxiv.org