跳到正文
Hugging Face Daily Papers·· 2026-08-19AI 评分49

StartupBench:面向市场验证的端到端工作流评测通用智能体

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者推出 StartupBench,一个基于市场验证 AI 创业产品构建的端到端智能体基准,将真实产品工作流转化为面向交付物的任务并用细粒度评分标准评估。在统一 agent harness 下,最强模型也仅能完成约 30% 的任务,复杂指令遵循与领域专业知识是主要失败原因。结果表明许多已被市场验证的工作流仍超出当前通用智能体的可靠能力范围。

来源:Hugging Face Daily Papers · arxiv.org