跳到正文
@AYi_AInotes· @AYi_AInotes · X·· 2026-08-23AI 评分41
AI 导读

一张 AI 大模型天梯榜引发争议,作者 Theo 回应称若只看智商排名而忽略成本、速度和可靠性是误读。该榜实为重度开发者自费跑推理的工程账本:同一复杂任务 Sol 仅耗 3k-15k tokens,Fable 需 30k+,Gemini 高达 70k-100k,token 浪费率过高导致 Google 被排到底层。

正文

AI圈今天因为这张AI大模型天梯榜都吵翻天了,有人喷搞主观偏见,有人拿 SWE-bench 帮 Opus 喊冤,但绝大多数人都看漏了这张图下面最致命的一句话。

Theo 自己在评论区直接回了一句:如果你把这张图当成单纯的智商排名,而忽略了成本、速度和可靠性,那是你自己的问题。

这张图根本不是什么跑分榜,而是一个每周自费几千刀跑推理的重度开发者,用真金白银砸出来的工程账本。

在 2026 年,评价一个 Coding 模型的标准早就变了:

一个是算力效率与单任务成本,同一个复杂任务,Sol 只吃 3k-15k tokens,Fable 要吞 30k+,而 Gemini 动辄拉到 70k-100k。

模型再聪明,如果完成一个任务要多烧 10 倍 token,在生产环境里就根本没法当日常工具用。

这就是为什么 Google 被扔到底层,不是它不聪明,是 token 浪费率太恐怖了。

第二个是代码品味与可合并度,Code Taste。
顶级模型和普通模型的区别,已经从能不能跑通,变成了生成的 PR 需不需要你大改。

→Fable 贵且有时绕路,但它对现有 codebase 的尊重程度和架构品味目前独一档;

→Sol 则是执行力极强的可靠老黄牛,死磕指令、不乱删文件。

第三个是委托级别,Delegation vs Micromanagement,低端模型需要你写一句 Prompt 改一段,顶级模型是你丢一个模糊需求,它直接交付可 Review 的完整 PR。

以前大家争的是谁在榜单上分最高,现在重度用户算的是谁能让我只当 Reviewer,同时月底 API 账单不爆炸。

Fable 是你遇到硬骨头架构时花大钱请的天才顾问,Sol 才是你每天真正带去上班的可靠主力。

所以咱们也别拿实验室跑分去指导真实工程决策,这中间差着一个数量级的真实成本吧 hhh

来源:@AYi_AInotes · x.com