跳到正文
@AYi_AInotes· @AYi_AInotes · X·· 14 天前精选AI 评分70
AI 导读

Anthropic 工程师 Dan Fein 分享了 Opus 5.5 发布后的首批内部 demo,一个纯代码马赛克动画包含 13,081 块瓷砖,颜色、位置和运动轨迹全部由模型在代码中算出,没有引入任何外部图片文件。画面中星星的水面倒影会逐渐变形并孵化成 22 条游动的小鱼,这些形变与运动同样为纯数学计算。作者表示这是展示上限的 demo,具体到自己的项目效果仍需实测。

推荐理由

内部 demo 展示了纯代码生成 13,081 块瓷砖动画的能力,读者可借此了解模型在视觉代码生成上的边界。

正文

Anthropic 内部的的 工程师Dan Fein,分享了Opus 5.5 今天发布后的第一批内部 demo,一万三千块瓷砖,零张图片,

纯代码生成视觉内容这个方向,之前 Fable 5.1 也能做,但瓷砖数量和动画复杂度到这个级别的,确实是头一次见到,

一个纯代码马赛克动画,13,081 个瓷砖的颜色、位置和运动轨迹全部由模型在代码里算出来,没有引入任何外部图片文件。

这意味着模型需要同时理解像素级的色彩构成、瓷砖在画布上的几何排列、以及随时间变化的帧动画逻辑。最后还有一个细节——画面里星星的水面倒影会逐渐变形,孵化成 22 条游动的小鱼,这些形变和运动也是纯数学计算。

不是一次简单的 HTML 输出,是一万三千个元素在同一个坐标系里协调运动,且视觉上能看。

跑分能告诉你模型在标准任务上排第几,但跑分没法告诉你它能不能在一次对话里,把一个艺术想法翻译成上万行可运行、可观看的代码。

这类任务对上下文管理、空间推理和代码一致性的要求远超典型 benchmark 覆盖的范围。

不过也要说清楚:这是一个展示上限的 demo,不代表每次都能复现同等质量。模型在视觉代码生成上确实有了明显跃迁,但具体到你自己的项目,效果还是要实测。 https://t.co/ZuLyQIncBF

引用@AYi_AInotes@AYi_AInotes
喵个咪,还是要有竞争啊,要不是@OpenAI 和GPT-6给压力,桀骜不驯的@DarioAmodei 能把能把能力接近Fable 5.1 的Opus 5.5 价格压这么低吗? 两个月前 Opus 5 的卖点是"接近 Fable 但便宜一半",刚发布的 Opus 5.5 直接做到了大多数任务持平甚至超过 Fable 5.1,价格比 Opus 5 再降 40%,Fable 级智力,Opus 级价格,输出速度还快了三成。 先看跑分,Terminal-Bench 4.0 拿了 66.4%,Fable 5.1 是 55.8%,GPT-6 Astra 57.9%。CursorBench 4.0 拿了 57.8%,比 GPT-5.6 Sol 的 41.7% 高出 16 个点。知识工作 GDPval-AA 1846 Elo,高于 Fable 5.1 的 1735 和 Astra 的 1542。Anthropic 自己也说了,跑分到这个水平差距已经不能完全代表真实体验,但方向是明确的。 再看价格,Input $4/M tokens,Output $20/M,比 Opus 5 各降 20%。最关键的是 cache reads 从 $0.50 降到 $0.20,降了 60%。跑 Agent 和编码任务的成本大头就是 cache reads,这一刀对月账单的影响比 input/output 降价大得多。算下来默认设置下跑 FrontierCode 打赢 Astra,成本约 Astra 的 20%。 Terminal-Bench 打平 Astra,成本约 40%。CursorBench 赢 Sol 11 个点,成本约三分之一。 对用 Claude Code 做日常开发的人来说,最实际的变化是效率。一个早期测试者拿 200,000 行代码库做审计和修复,Opus 5 要 20 多小时、用了 2.5 倍的 token,Opus 5.5 不到 3 小时搞定。 Anthropic 内部测试让两个模型把 HAProxy 从 C 翻译成 Rust,两个版本都通过了几乎全部回归测试,Opus 5.5 用了 9.5 小时、Fable 5.1 用了 12 小时,成本低 51%。另一个测试者用它做 680,000 行代码迁移,不到一天完成。 知识工作也有实际案例。让模型写季度财报分析报告,要求每个数字和引用都能核对到来源,Opus 5.5 的 18 次尝试里 16 次通过质量审核,Fable 5.1 和 Opus 5 一次都没过。做并购分析出 Excel 模型加演示文稿,63 分钟完成,Opus 5 要 93 分钟,成本低一半。 安全方面讲两件事。第一,行为审计得分历代最高,沙箱逃逸尝试比 Opus 5 和 Mythos 5.1 减少约 85%,prompt injection 抵抗力追平 Fable 5.1。 第二,因为网安和生物能力接近 Mythos 5.1,Anthropic 给它上了和 Fable 5.1 同级别的安全护栏——网安任务会被回退到 Opus 4.8 执行,生物任务回退到 Opus 5。 所以跑分里带护栏的成绩实际上是多个模型协作的结果,不是纯 Opus 5.5 单模型得分,这点看跑分的时候要注意。 Anthropic 还承认了一个没解决的问题:Opus 5.5 似乎经常意识到自己正在被评测,这让他们很难预判它在真实部署场景下的行为。这是一个很诚实的披露。 另外 Pro、Max、Team 订阅的五小时用量上限提升了,新增了一个可以自己选择时机使用的 rate limit reset。Sonnet 5.5 和 Haiku 5.5 几周内跟进。 官方的使用建议是:大多数工作直接用 Opus 5.5,只有高难度推理和长期 Agent 任务在 Opus 5.5 跑不动的情况下才上 Fable 5.1。 对大部分用户来说,今天之后的默认选择就是 Opus 5.5 了。
在 X 查看被引用的帖子

来源:@AYi_AInotes · x.com