Sierra Blog· Ben Shi, Keshav Dhandhania·· 25 天前精选AI 评分64
Sierra 开源 Hyper-𝜏-bench 基准,评测模型构建智能体的能力
Hyper-𝜏-bench: Evaluating agents that build agents
AI 导读
Sierra 开源 Hyper-𝜏-bench(论文发表为 𝜏^𝜏-bench),一个长程智能体评测,衡量模型能否端到端构建出可用的客服智能体。开发者智能体在沙箱内从模拟业务记录和模拟客户端恢复规格、设计架构并生成工具,成品在未见过的 𝜏-bench 式测试上验证。
推荐理由
该基准由 Sierra 开源,独立与协同工程师两种配置的分数对比和五类失败模式,为理解智能体构建能力提供了参考。
来源:Sierra Blog · sierra.ai