跳到正文
@AYi_AInotes· @ayi_ainotes · X·· 2026-05-27AI 评分41
AI 导读

DeepSWE 新基准显示顶级模型编码能力差距远超旧基准:GPT-5.5 得分 70%,Claude Opus 仅 54%,其他模型直接腰斩。该基准要求模型完成找文件、复现 bug、修改验证、处理边缘 case 等完整流程,而非简单改一行代码。用 mini-swe-agent 跑出的结果与各实验室官方工具相当,说明旧基准高分多靠 prompt 工程刷出。

正文

Damn,DeepSWE 这个新基准有一件事让我想明白了:以前的顶级模型可能没我们想的那么强🤔

而且我感觉这次AI 编码评测好像出了个超狠的东西,我觉得老基准可能全测错了。

以前 SWE-Bench 上,顶级模型分数全挤在 54%-64%,看起来半斤八两,

但 DeepSWE 不一样,不是单纯的考你改一行代码,它会让你真干活:找文件、复现 bug、改完验证、处理边缘 case。

@theo 说这是他第一次感觉和日常写代码体验对上了的基准。

经过这么一测,差距直接炸开:GPT-5.5 是 70%,Claude Opus 是 54%,其他直接腰斩。

最狠的还不是分数差距

他们用一个很简单的 mini-swe-agent 去跑,结果和各大 lab 自己调了半天的官方工具差不多。

这意味着很多好成绩不是模型强,是 prompt 工程刷的。

但是DeepSWE 不给你准备时间,直接来,差距一下子就出来了。

以前是大家都化好妆站一排,现在是直接掀帘子进浴室🤣

所以我自己的判断是:

1. 以后看模型真实 coding 能力,多看一眼这种长任务基准,少看短平快刷分榜

2. 选开发工具时,别看它主页上标的分,自己扔一个真 bug 让它改,改完跑通才算

现在新基准这面照妖镜举起来了,后面刷分的怕是要睡不着了 hhh

引用Theo - t3.gg (@theo)@theo
This is the first code bench that actually aligns with how it feels to use these models coding.
在 X 查看被引用的帖子

来源:@AYi_AInotes · x.com