跳到正文
Hugging Face Daily Papers·· 25 天前AI 评分48

T1:面向长时程任务的终端 Agent 强化学习

T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究团队推出 T1,一个 122B 总参数的 Mixture-of-Experts 模型,通过强化学习在云沙箱中操作真实 shell,单任务支持 300+ 轮工具调用,并以任务自带 verifier 执行结果作为奖励。

来源:Hugging Face Daily Papers · arxiv.org