LEGO-RL:面向编码智能体的 Harness 原生强化学习框架
LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
LEGO-RL 是一个让编码智能体在不改动原生 harness 控制流的前提下进行策略梯度训练的强化学习框架,通过进程内 LLM 代理、沙箱编排与可观测训练插件解决环境崩溃、reward hacking 和训推不一致问题。
来源:Hugging Face Daily Papers · arxiv.org