Anthropic 工程师 Thariq 发布关于 Claude Code effort 旋钮的深度复盘,指出该档位控制的是模型在当前能力下投入多久,而不是变聪明多少。
把 Claude Code 的 effort 档位与需求清晰度挂钩,给出了从出原型到补测试的分步调参依据。
Thariq这篇关于Claude Code effort旋钮的文章,看完直接把我之前的用法全推翻了,有点Claude code 调参大师课的感觉,墙裂推荐收藏学习!
先说结论,用 Claude Code 还在无脑把 effort 拧到最大的人,大概率一直在白白烧钱。
Anthropic 核心工程师 Thariq 刚放出的这篇深度复盘,把内部调参的底牌全亮了出来:
这个旋钮控的从来不是模型变聪明了多少,而是你允许它在当前能力下加多久班。
在内部几百次极限测试里,Token 消耗从中位 7 万飙到 22 万,安全漏洞通过率能从 64% 强行拉到 87%;
但测试图里那条分界线极其冰冷,它能消灭漏网的边角 bug,但路子一开始走错的架构死穴,加再多班也救不回来。
真正让我觉得有意思的是,需求清晰度一变,effort 的意义会被完全改写。
当你随口提一句模糊需求,Low 档只花 1.5 分钟给你一个骨架,方便你当场打回修改;Max 档会闷头跑 67 分钟,自作主张塞满各种多余的复杂图表,反而增加了你的返工成本。
只有当你把规格定义得严丝合缝,高档位才不再瞎堆功能,转头去当严苛的测试负责人,自己读源码找漏洞、写随机测试套件硬砸边界。
更实用的一点在于工程解耦,
会话中途直接敲斜杠命令切档,完全不破坏 prompt cache,前文几万 Token 的上下文不会重复计费。
官方作者自己现在写功能,根本不是一上来就开最大,而是守着一套四步循环:
先让模型采访自己把暗坑问出来,接着用 Low 档一分钟出原型看方向;人在环里确认路子没走歪,最后才切到 High 档让它自己去补全单测和边界防护。
低档买速度与掌控权,高档买对抗审查与极端防翻车。
你想亲自盯着就留在低档,想把钥匙扔给它下班才开 Max。
What is effort really? When do you change it it and why not just use max effort for everything? I dove deep into this problem, looking into evals and doing my own tests and I was quite surprised by the results. https://t.co/KO2D51j34H在 X 查看被引用的帖子
来源:@AYi_AInotes · x.com