研究揭示 Evolution Strategies 在 LLM 推理上比 GRPO 覆盖更广
Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
一项研究系统分析了 Evolution Strategies(ES)用于 LLM 推理后训练的优化机制,理论与实验均显示 ES 能带来比 GRPO 更广的推理覆盖,在提升 Pass@1 的同时取得更高 Pass@K,而 GRPO 会出现熵坍缩。
来源:Hugging Face Daily Papers · arxiv.org