Cliff:从第一个错误中学习过程奖励
Cliff: Learning Process Rewards from the First Mistake
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
针对 RLVR 依赖粗粒度结果奖励、对中间推理过程指导不足的问题,研究者提出奖励塑形策略 Cliff,用现成 LLM 作为教师识别每条 rollout 中的第一个错误,将轨迹拆分为正确前缀与错误后缀,并转化为 token 级优势。在 12 个场景的实验中,Cliff 持续提升推理表现,分别超过 on-policy distillation 15%、标准 GRPO 7%,即使教师模型能力一般也有效。
来源:Hugging Face Daily Papers · arxiv.org