跳到正文
Hugging Face Daily Papers·· 2026-08-25AI 评分41

ERPO:把正则化移到输入侧,破解 LLM 策略优化的稳定性-探索困境

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者提出 Environment-Regularized Policy Optimization(ERPO),用 Query-KL(QKL)项约束训练查询分布漂移,替代动作侧的 Policy-KL 正则化,从而保留响应侧的探索空间。

来源:Hugging Face Daily Papers · arxiv.org