跳到正文
arxiv.org(经 Hacker News)·· 2026-08-16AI 评分30

RL for LLM Reasoning 是稀疏策略选择,而非能力学习

RL for LLM Reasoning Is Sparse Policy Selection, Not Capability Learning

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

一篇讨论文章提出,针对 LLM 推理的强化学习本质上是稀疏策略选择,而不是能力学习。该观点认为 RL 并未真正让模型习得新能力,只是在已有策略空间中挑选稀疏路径。原文未给出具体模型、参数或实验数据。

来源:arxiv.org(经 Hacker News) · arxiv.org