RL for LLM Reasoning 是稀疏策略选择,而非能力学习
RL for LLM Reasoning Is Sparse Policy Selection, Not Capability Learning
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
一篇讨论文章提出,针对 LLM 推理的强化学习本质上是稀疏策略选择,而不是能力学习。该观点认为 RL 并未真正让模型习得新能力,只是在已有策略空间中挑选稀疏路径。原文未给出具体模型、参数或实验数据。
来源:arxiv.org(经 Hacker News) · arxiv.org