跳到正文
Hugging Face Daily Papers·· 2026-09-04AI 评分40

面向终端智能体的环境演化方法

Environment Evolution for Terminal Agents

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者提出"环境演化"方法,通过离策略方式逐步提升环境难度并按代调度生成,为终端智能体训练持续提供学习信号。在 Qwen3.6-27B 和 Qwen3.6-35B-A3B 上经长程 RL 训练,二者在 Terminal-Bench 2.1 上分别提升 14.4 和 18.0 个百分点。

来源:Hugging Face Daily Papers · arxiv.org