跳到正文
Hugging Face Daily Papers·· 2026-08-20AI 评分43

LEGO-RL:面向编码智能体的 Harness 原生强化学习框架

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

LEGO-RL 是一个让编码智能体在不改动原生 harness 控制流的前提下进行策略梯度训练的强化学习框架,通过进程内 LLM 代理、沙箱编排与可观测训练插件解决环境崩溃、reward hacking 和训推不一致问题。

来源:Hugging Face Daily Papers · arxiv.org