Hugging Face Daily Papers·· 1 天前AI 评分44
Argo-Bench:评估数据智能体在企业级工作流中的表现
Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows
AI 导读
Argo-Bench 是一个包含 210 个数据科学与分析任务的评估框架,模拟纽约市外卖平台,导出为 235 张表、75 亿行的 ERP 仓库,智能体需先重建事实再执行封禁欺诈账号、分配骑手激励预算等操作,评分依据模拟器中的后果。14 个前沿与开源模型中最强者在仅 34.8% 的任务上得分达 95 以上,平均 59.5 分。
来源:Hugging Face Daily Papers · arxiv.org