τ^τ-Bench:面向端到端真实智能体构建的评测环境
τ^τ-Bench: An Environment for End-To-End, Realistic Agent Construction
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出 τ^τ-Bench(读作 hyper-tau-bench),把构建 LLM 智能体本身当作任务:开发智能体拿到企业真实记录、持有需求的客户、必须走通的生产 API、待继承的代码库以及服务成本与模型限制,需据此交付完整的客服智能体,并通过将该智能体部署到留出的模拟用户上来评分。
来源:Hugging Face Daily Papers · arxiv.org