OpenAI 质疑评测基准 SWE-Bench Pro,称约 30% 任务存在评测缺陷
OpenAI 挑战 AI 评测基准 SWE-Bench Pro:约 30% 存在评测缺陷
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
OpenAI 发布博文质疑评测基准 SWE-Bench Pro,估计 731 个公开测试任务中约 30% 存在评测缺陷,并撤回此前对其的采用建议。OpenAI 指出前沿模型在 8 个月内通过率从 23.3% 升至 80.3%,认为该基准已难以有效评估模型的软件开发能力。
来源:IT Home · ithome.com