跳到正文
Hugging Face Daily Papers·· 2026-09-03AI 评分40

Cliff:从第一个错误中学习过程奖励

Cliff: Learning Process Rewards from the First Mistake

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

针对 RLVR 依赖粗粒度结果奖励、对中间推理过程指导不足的问题,研究者提出奖励塑形策略 Cliff,用现成 LLM 作为教师识别每条 rollout 中的第一个错误,将轨迹拆分为正确前缀与错误后缀,并转化为 token 级优势。在 12 个场景的实验中,Cliff 持续提升推理表现,分别超过 on-policy distillation 15%、标准 GRPO 7%,即使教师模型能力一般也有效。

来源:Hugging Face Daily Papers · arxiv.org