ERPO:把正则化移到输入侧,破解 LLM 策略优化的稳定性-探索困境
Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出 Environment-Regularized Policy Optimization(ERPO),用 Query-KL(QKL)项约束训练查询分布漂移,替代动作侧的 Policy-KL 正则化,从而保留响应侧的探索空间。
来源:Hugging Face Daily Papers · arxiv.org