跳到正文
Hugging Face Daily Papers·· 29 天前AI 评分54

τ^τ-Bench:面向端到端真实智能体构建的评测环境

τ^τ-Bench: An Environment for End-To-End, Realistic Agent Construction

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者提出 τ^τ-Bench(读作 hyper-tau-bench),把构建 LLM 智能体本身当作任务:开发智能体拿到企业真实记录、持有需求的客户、必须走通的生产 API、待继承的代码库以及服务成本与模型限制,需据此交付完整的客服智能体,并通过将该智能体部署到留出的模拟用户上来评分。

来源:Hugging Face Daily Papers · arxiv.org