跳到正文
Hugging Face Daily Papers·· 2026-08-28AI 评分45

研究揭示 Evolution Strategies 在 LLM 推理上比 GRPO 覆盖更广

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

一项研究系统分析了 Evolution Strategies(ES)用于 LLM 推理后训练的优化机制,理论与实验均显示 ES 能带来比 GRPO 更广的推理覆盖,在提升 Pass@1 的同时取得更高 Pass@K,而 GRPO 会出现熵坍缩。

来源:Hugging Face Daily Papers · arxiv.org