OPDVR:用可验证奖励改造 on-policy 蒸馏,无需额外超参数
On-policy Distillation with Verifiable Reward
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出 OPDVR,将 on-policy 蒸馏(OPD)与可验证奖励强化学习(RLVR)无缝结合且不引入任何额外超参数。该方法先基于轨迹正确性重构采样 token OPD 的隐式奖励,再用 ReLU 门控让正确轨迹获得非负奖励、错误轨迹获得非正奖励,从而把采样 token OPD 变成标准 RLVR 方法,可直接搭配 GRPO 等策略梯度算法。
来源:Hugging Face Daily Papers · arxiv.org