跳到正文
IT Home·· 2026-07-09AI 评分65

OpenAI 质疑评测基准 SWE-Bench Pro,称约 30% 任务存在评测缺陷

OpenAI 挑战 AI 评测基准 SWE-Bench Pro:约 30% 存在评测缺陷

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

OpenAI 发布博文质疑评测基准 SWE-Bench Pro,估计 731 个公开测试任务中约 30% 存在评测缺陷,并撤回此前对其的采用建议。OpenAI 指出前沿模型在 8 个月内通过率从 23.3% 升至 80.3%,认为该基准已难以有效评估模型的软件开发能力。

来源:IT Home · ithome.com