Together AI 用 DeepSWE 做了 113 个真实软件工程任务、每个任务跑 4 次共 904 次 rollout 的对比,比较 GPT-5.6 Sol 与 DeepSeek V4 Pro 0813。
最近 Together AI 用 DeepSWE 做了一组对比:113 个真实软件工程任务,每个任务跑 4 次,一共 904 次 rollout。
单次执行,GPT-5.6 Sol 明显更强,pass@1 是 72.7%;DeepSeek V4 Pro 0813 只有 62.8%。
但如果允许重试,结果反过来了:
DeepSeek V4 Pro 的 pass@4 达到 88.5%,超过 Sol 的 85.8%。
原因不是 DeepSeek 每一次都更可靠。
恰恰相反,Sol 更稳定、更快,单次运行中位时间 17 分钟,DeepSeek 要 35 分钟。
真正拉开差距的是价格:DeepSeek 一次 rollout 平均 0.24 美元,Sol 是 8.37 美元,相差约 35 倍。
于是最优解既不是只用 Sol,也不是为了便宜全部换成 DeepSeek。
而是:
先让 DeepSeek 跑,测试通过就交付;测试失败,再升级给 Sol。
这套 cascade 最终解出了 83% 的任务,平均每个任务 3.35 美元。相比单独使用 Sol,成功率从 72.7% 提高到 83%,成本反而从 8.37 美元降到了 3.35 美元。
这组数据当然不能直接外推到所有业务。
DeepSWE 是软件工程任务,低价模型多跑几次也会增加延迟;如果用户正在同步等待,Sol 的速度和稳定性依然值钱。
但它说明了一个很重要的趋势:
企业做 AI,越来越不应该问“到底选哪一个最强模型”,企业应该把重点放在“不同任务该如何路由,失败以后如何重试,什么情况下升级到更强的模型,最终又由什么机制验收结果”。
模型只是原材料。
真正决定企业 AI 成本和效果的,是模型路由、测试验证、失败升级、回退机制,以及整套系统能不能根据任务难度动态分配智能。
企业 AI 的竞争要看谁把一群能力和价格不同的模型,组织成了一支真正能打的球队。
很显然,大家都意识到了这一点。
https://t.co/SPXQtSudM8
来源:@frxiaobei · x.com