ASCENT:通过自蒸馏验证经验实现在线测试时训练的长程智能体
ASCENT: Online Test-Time Training of Long-Horizon Agents via Self-Distillation of Verified Experience
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
ASCENT 提出一种在线智能体测试时训练方法,让 LLM 在部署过程中用自身执行轨迹更新权重,通过将验证过的轨迹作为特权信息自蒸馏进持久 LoRA 快速权重,无需外部参考解或更强教师模型。在 ALFWorld、WebShop 和 AppWorld 上,ASCENT 随经验积累提升任务成功率与交互效率,优于在线适应方法,并可迁移到未见场景。
来源:Hugging Face Daily Papers · arxiv.org