面向终端智能体的环境演化方法
Environment Evolution for Terminal Agents
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出"环境演化"方法,通过离策略方式逐步提升环境难度并按代调度生成,为终端智能体训练持续提供学习信号。在 Qwen3.6-27B 和 Qwen3.6-35B-A3B 上经长程 RL 训练,二者在 Terminal-Bench 2.1 上分别提升 14.4 和 18.0 个百分点。
来源:Hugging Face Daily Papers · arxiv.org