一套名为 J-Space 的提示词工作流工具在不改模型参数的情况下,让 DeepSeek V4-Pro 在 Terminal Bench 从 87.9 升至 90.1、DeepSWE 从 62.7 升至 72.0、NL2Repo 从 61.5 升至 73.4,多项超过 Fable 5。
Damn,DeepSeek V4-Pro竟然超过了Fable 5?!🤯。。。
这可能是我这周看到最炸的一件事,甚至可以说是今年AI圈最恐怖的一个发现,我直接把手里所有模型对比方案全停了,
有人用一套外挂系统,没改模型一个参数,让DeepSeek V4-Pro直接干翻了Fable 5,
这个叫J-Space的东西,本质上就是一套智能提示词加工工作流管理工具,
它不给模型加任何能力,只做一件事,让模型别走神,
DeepSeek V4-Pro本身已经很猛了,但一到复杂多步骤、需要调用工具的长任务,就开始乱想,忘记自己做到哪,一步错步步错,
J-Space给它配了一个清晰的记事本和进度表,强制它每做完一步就验证,出错立刻回退纠正,思考过程固定在统一的结构里不跑偏,
然后跑分出来,所有人都傻了,
Terminal Bench终端操作,87.9干到90.1,
DeepSWE软件工程,62.7干到72.0,
NL2Repo自然语言建仓库,61.5直接干到73.4,
好几个项目直接超过了目前公认很强的Fable 5,
作者说了一句特别到位的话,模型一直很强,之前只是能力没被正确释放出来,
说实话,看完这些数字我有点头皮发麻,
我们天天追着新模型跑,比参数比基准比谁更聪明,但这个实验直接证明了一件事,
同样的模型,换一套harness,表现能差出一个档次,
模型本身的差距,正在被使用方法的差距追平甚至反超,
当然也得泼盆冷水,这些分数是作者自己单次跑出来的,还没有第三方独立验证,社区已经有人测了,部分任务提升不明显,还多花时间和token,
模型没有变聪明,它只是更稳了,能把已有的能力完整地发挥出来,
但这个方向本身,比跑分重要一万倍,
所以大家以后别再问哪个模型最强了,真正拉开差距的,是谁能给模型配上一套最科学的干活方法。
#DeepSeek #AI #Agent
来源:@AYi_AInotes · x.com