跳到正文
原文
Sierra Blog· Ben Shi, Keshav Dhandhania·· 25 天前精选AI 评分64

Sierra 开源 Hyper-𝜏-bench 基准,评测模型构建智能体的能力

Hyper-𝜏-bench: Evaluating agents that build agents

AI 导读

Sierra 开源 Hyper-𝜏-bench(论文发表为 𝜏^𝜏-bench),一个长程智能体评测,衡量模型能否端到端构建出可用的客服智能体。开发者智能体在沙箱内从模拟业务记录和模拟客户端恢复规格、设计架构并生成工具,成品在未见过的 𝜏-bench 式测试上验证。

推荐理由

该基准由 Sierra 开源,独立与协同工程师两种配置的分数对比和五类失败模式,为理解智能体构建能力提供了参考。

来源:Sierra Blog · sierra.ai