让 LLM 在 RL 中学会永不放弃:Never Give Up 自适应采样方法
Learning to Solve Hard Problems in RL for LLMs by Never Giving Up
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究提出 Never Give Up(NGU)自适应采样方法,通过异步 RL 持续为同一问题生成样本直到答对,将算力从简单题重新分配给难题。作者称 RL 对 LLM 存在"马太效应":简单题提升大、难题提升小。在数学基准 Deepscaler 上 NGU 提升了单位算力性能,在编程任务 Manufactoria 上,标准 GRPO 无法完全解题,NGU 则迭代攻克越来越难的测试直至完全解决。
来源:Hugging Face Daily Papers · arxiv.org