跳到正文
@AYi_AInotes· @AYi_AInotes · X·· 2026-08-18AI 评分50
AI 导读

Stanford 团队让 DeepSeek V4 Flash 对同一任务生成 5 个答案并自行当裁判打分挑优,在 Terminal-Bench 2.1 上把成绩从 79% 提升到 88%,称超过 Claude 最新的 Fable 5,成本只有对方的十一分之一。

正文

Stanford这帮人可能找到了今年最狠的Claude、ChatGPT平替路线,我直接把手里所有闭源模型订阅全停了,这可能是今年开源AI最狠的一次逆袭。。

Stanford的人用DeepSeek V4 Flash,
同一个任务生成5个答案,
再让同一个模型自己当裁判打分,
挑最高分的那个交卷。

Terminal-Bench 2.1,
79%直接干到88%,
超过了Claude最新的Fable 5,
成本只有对方的十一分之一。

全网都在喊开源吊打闭源,
但90%的人没看懂真正的信号。

生成端早就卷到头了。
真正拉开差距的是验证。

以前大家拼模型参数,
拼训练数据,
拼基准测试高0.5。
现在发现,
同一个便宜模型多跑几次,
再自己挑出最好的,
就能干翻贵11倍的旗舰。

这就是test-time scaling的真正玩法。
模型不用做大,
推理时多花一点算力,
用生成加验证换效果。

验证本身还能继续缩放,
更细的评分标准,
多验证几轮,
把评价维度拆得更碎。

框架已经开源,
任何人都能拿DeepSeek V4 Flash直接复现。

模型是引擎,
验证才是刹车和方向盘。
引擎够猛就行,
没有刹车和方向盘谁也不敢开快。

我觉得接下来所有agent框架都会默认加上自验证这一层吧 hhh

来源:@AYi_AInotes · x.com