DRACO:用动态评分标准为长时程智能体训练做细粒度信用分配
DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
DRACO 提出一种基于动态评分标准(rubric)的信用分配方法,用于无真值成功信号的长时程智能体训练:训练中动态生成 rubric 以跟踪策略能力变化,每条完整轨迹评分一次,再将判断以闭式解重新分配到各步骤,在 GRPO 中产生差异化的逐步优势,且不引入额外训练归因模块。
来源:Hugging Face Daily Papers · arxiv.org