可验证奖励强化学习中的验证器诱导支持重塑
Verifier-Induced Support Reshaping in On-Policy Optimization
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究发现,带可验证奖励的在线策略强化学习(RLVR)会在提升当前目标的同时,让后续目标所需的成功行为变得难以采样。在 Qwen3-8B-Base 的 IFEval 上,pass@1 上升 6.5 个百分点,而 best@32 下降 9.8 个百分点,且该分化在两个模型家族和多个 IF 基准上均出现。这类变化集中在回答最前面的几个 token,RLVR 主要是在重排基座策略已有的开头方式。
来源:Hugging Face Daily Papers · arxiv.org