跳到正文
Factory 研究 / 产品·· 2026-04-01精选AI 评分61

Factory 发布 Legacy-Bench 基准,检验 AI 智能体维护遗留软件的能力

Legacy-Bench: Can AI Agents Maintain the World's Most Critical Software?

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

Factory 发布 Legacy-Bench 基准,用涵盖 COBOL(46%)、Java 7(32%)等六类遗留语言的数百个任务测试 AI 智能体,12 个模型-智能体组合的通过率为 16.9% 至 42.5%,而这些模型在 SWE-bench Verified 等现代基准上得分超过 70%。

推荐理由

原文用真实遗留代码任务填补现有基准的盲区,给出各模型在 COBOL 等语言上的具体分数和失败模式,可帮助读者评估 AI 智能体处理关键遗留系统的实际能力。

来源:Factory 研究 / 产品 · factory.com