跳到正文
Hugging Face Daily Papers·· 2026-08-17AI 评分44

可验证奖励强化学习中的验证器诱导支持重塑

Verifier-Induced Support Reshaping in On-Policy Optimization

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究发现,带可验证奖励的在线策略强化学习(RLVR)会在提升当前目标的同时,让后续目标所需的成功行为变得难以采样。在 Qwen3-8B-Base 的 IFEval 上,pass@1 上升 6.5 个百分点,而 best@32 下降 9.8 个百分点,且该分化在两个模型家族和多个 IF 基准上均出现。这类变化集中在回答最前面的几个 token,RLVR 主要是在重排基座策略已有的开头方式。

来源:Hugging Face Daily Papers · arxiv.org