跳到正文
Hugging Face Daily Papers·· 2026-09-05AI 评分55

论文定位 RLVR 解空间收窄位置:损失集中在推理入口

Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

一篇论文定位了 RLVR 收窄解空间的位置,在对 Qwen2.5-3B 的 PPO 与 GRPO 训练中,解法覆盖率最多下降 67%。研究发现收缩集中在推理轨迹入口,首个算术操作前的每 token 似然偏移是后续推理的 11 到 16 倍,仅提供未被选中的入口前缀就能把低覆盖家族的完成率从 0.018 提升到 0.212。

来源:Hugging Face Daily Papers · arxiv.org