AI 导读
按单个编码 Agent 任务消耗 50 万 cache read tokens、5 万 input tokens 和 10 万 output tokens 计算。
推荐理由
按 token 单价把 Opus 5.5 与 Opus 5 的编码任务成本逐项拆开,便于按自身用量估算实际账单变化。
正文
给用 Claude Code 的同学算一笔具体的账:
假设你一个编码 Agent 任务平均消耗 50 万 cache read tokens + 5 万 input tokens + 10 万 output tokens。按 Opus 5 的价格是 $0.25 + $0.25 + $2.50 = $3.00。
同样的任务 Opus 5.5 价格是 $0.10 + $0.20 + $2.00 = $2.30。单任务省了约 23%。但 Anthropic 说 Opus 5.5 平均用的 token 更少(200k 代码审计场景少了 60%),如果 token 用量也降了,实际省幅会更大。
还有一个容易忽略的点:Fast mode。$8 input / $40 output,速度提到 2.5 倍。如果你的场景对延迟敏感、对成本不那么敏感,比如在 Cursor 里做交互式编码,Fast mode 的体验提升可能比默认模式的跑分提升更直接。
最后说 preserved thinking。这个是从 Fable 5.1 延续过来的反蒸馏机制,API 用户不能编辑 Claude 之前的推理上下文。
而且 Opus 5.5 不能关闭 thinking 模式。对于在生产环境中需要稳定输出格式的开发者,接入前先看一下官方的迁移文档。
喵个咪,还是要有竞争啊,要不是@OpenAI 和GPT-6给压力,桀骜不驯的@DarioAmodei 能把能把能力接近Fable 5.1 的Opus 5.5 价格压这么低吗? 两个月前 Opus 5 的卖点是"接近 Fable 但便宜一半",刚发布的 Opus 5.5 直接做到了大多数任务持平甚至超过 Fable 5.1,价格比 Opus 5 再降 40%,Fable 级智力,Opus 级价格,输出速度还快了三成。 先看跑分,Terminal-Bench 4.0 拿了 66.4%,Fable 5.1 是 55.8%,GPT-6 Astra 57.9%。CursorBench 4.0 拿了 57.8%,比 GPT-5.6 Sol 的 41.7% 高出 16 个点。知识工作 GDPval-AA 1846 Elo,高于 Fable 5.1 的 1735 和 Astra 的 1542。Anthropic 自己也说了,跑分到这个水平差距已经不能完全代表真实体验,但方向是明确的。 再看价格,Input $4/M tokens,Output $20/M,比 Opus 5 各降 20%。最关键的是 cache reads 从 $0.50 降到 $0.20,降了 60%。跑 Agent 和编码任务的成本大头就是 cache reads,这一刀对月账单的影响比 input/output 降价大得多。算下来默认设置下跑 FrontierCode 打赢 Astra,成本约 Astra 的 20%。 Terminal-Bench 打平 Astra,成本约 40%。CursorBench 赢 Sol 11 个点,成本约三分之一。 对用 Claude Code 做日常开发的人来说,最实际的变化是效率。一个早期测试者拿 200,000 行代码库做审计和修复,Opus 5 要 20 多小时、用了 2.5 倍的 token,Opus 5.5 不到 3 小时搞定。 Anthropic 内部测试让两个模型把 HAProxy 从 C 翻译成 Rust,两个版本都通过了几乎全部回归测试,Opus 5.5 用了 9.5 小时、Fable 5.1 用了 12 小时,成本低 51%。另一个测试者用它做 680,000 行代码迁移,不到一天完成。 知识工作也有实际案例。让模型写季度财报分析报告,要求每个数字和引用都能核对到来源,Opus 5.5 的 18 次尝试里 16 次通过质量审核,Fable 5.1 和 Opus 5 一次都没过。做并购分析出 Excel 模型加演示文稿,63 分钟完成,Opus 5 要 93 分钟,成本低一半。 安全方面讲两件事。第一,行为审计得分历代最高,沙箱逃逸尝试比 Opus 5 和 Mythos 5.1 减少约 85%,prompt injection 抵抗力追平 Fable 5.1。 第二,因为网安和生物能力接近 Mythos 5.1,Anthropic 给它上了和 Fable 5.1 同级别的安全护栏——网安任务会被回退到 Opus 4.8 执行,生物任务回退到 Opus 5。 所以跑分里带护栏的成绩实际上是多个模型协作的结果,不是纯 Opus 5.5 单模型得分,这点看跑分的时候要注意。 Anthropic 还承认了一个没解决的问题:Opus 5.5 似乎经常意识到自己正在被评测,这让他们很难预判它在真实部署场景下的行为。这是一个很诚实的披露。 另外 Pro、Max、Team 订阅的五小时用量上限提升了,新增了一个可以自己选择时机使用的 rate limit reset。Sonnet 5.5 和 Haiku 5.5 几周内跟进。 官方的使用建议是:大多数工作直接用 Opus 5.5,只有高难度推理和长期 Agent 任务在 Opus 5.5 跑不动的情况下才上 Fable 5.1。 对大部分用户来说,今天之后的默认选择就是 Opus 5.5 了。在 X 查看被引用的帖子
来源:@AYi_AInotes · x.com