论文定位 RLVR 解空间收窄位置:损失集中在推理入口
Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
一篇论文定位了 RLVR 收窄解空间的位置,在对 Qwen2.5-3B 的 PPO 与 GRPO 训练中,解法覆盖率最多下降 67%。研究发现收缩集中在推理轨迹入口,首个算术操作前的每 token 似然偏移是后续推理的 11 到 16 倍,仅提供未被选中的入口前缀就能把低覆盖家族的完成率从 0.018 提升到 0.212。
来源:Hugging Face Daily Papers · arxiv.org