T1:面向长时程任务的终端 Agent 强化学习
T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究团队推出 T1,一个 122B 总参数的 Mixture-of-Experts 模型,通过强化学习在云沙箱中操作真实 shell,单任务支持 300+ 轮工具调用,并以任务自带 verifier 执行结果作为奖励。
来源:Hugging Face Daily Papers · arxiv.org