Factory 发布 Legacy-Bench 基准,检验 AI 智能体维护遗留软件的能力
Legacy-Bench: Can AI Agents Maintain the World's Most Critical Software?
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Factory 发布 Legacy-Bench 基准,用涵盖 COBOL(46%)、Java 7(32%)等六类遗留语言的数百个任务测试 AI 智能体,12 个模型-智能体组合的通过率为 16.9% 至 42.5%,而这些模型在 SWE-bench Verified 等现代基准上得分超过 70%。
推荐理由
原文用真实遗留代码任务填补现有基准的盲区,给出各模型在 COBOL 等语言上的具体分数和失败模式,可帮助读者评估 AI 智能体处理关键遗留系统的实际能力。
来源:Factory 研究 / 产品 · factory.com