Anthropic Claude Code 团队炉边对话:谈 Claude Tag、auto mode 与代码审查
Simon Willison 与 Anthropic Claude Code 团队的 Cat Wu 和 Thariq Shihipar 进行炉边对话,讨论 Claude Code、Claude Tag、Fable、编码智能体安全、评估与工具设计。
simonwillison.net · 网站与博客
Simon Willison 与 Anthropic Claude Code 团队的 Cat Wu 和 Thariq Shihipar 进行炉边对话,讨论 Claude Code、Claude Tag、Fable、编码智能体安全、评估与工具设计。
编码智能体正在让家庭设备的逆向工程与自动化变得廉价。此前这类工作虽可行,但投入产出比低,且未文档化的不稳定 API 可能随时失效,维护成本令人却步。智能体大幅降低了让简单自动化跑通以及尝试失败的成本,代码足够便宜后,未来维护甚至推倒重来的心理负担也小得多。
Simon Willison 转述 Ben Thompson 的提议:美国应立法明确收集训练数据属于合理使用,并禁止服务条款限制蒸馏,以缓解实验室一边禁止蒸馏一边使用未授权数据的矛盾。
Sam Altman 在 2022 年 10 月 1 日致 OpenAI 董事会的邮件中提出,希望尽快发布一个能力接近 GPT-3、能在消费级硬件上本地运行的语言模型,赶在 Stability 或其他公司之前行动。这封由 Musk v. Altman 案(2026)曝光的邮件称,开源此类模型有助于劝阻他人发布同等能力的模型,并让新的同类项目更难获得融资。
推荐理由:2022 年的内部邮件经诉讼曝光,读者可借此了解 OpenAI 早期开源模型策略背后的竞争考量。
咨询顾问 Nik Suresh 指出,AI 狂热正严重扭曲大型企业的决策。他举例称,一位高管在为营收超 $2B 的组织制定完全围绕 AI 的技术战略后,承认自己从未用过 ChatGPT 或任何 AI 工具。还有工程师为保住工作,用 AI 把 Go 代码库重写成 Zig;供应商高管因担心客户合同被取消,不敢质疑客户宣称的 100x 生产力提升。
Simon Willison 用 strings 命令检查自己的 Claude Code 安装,验证其确实内置了 Rust 版 Bun。Jarred Sumner 称 Claude Code v2.1.181(6 月 17 日发布)及之后版本采用 Rust 移植的 Bun,Linux 上启动快约 10%。
Simon Willison 受 Julia Evans 启发,用 Claude 构建了一款交互式 SQLite 查询解释工具,可在浏览器中通过 Pyodide 以 WebAssembly 运行 Python 版 SQLite,为 EXPLAIN 和 EXPLAIN QUERY PLAN 的结果附加解释层。作者提醒,因自身对 SQLite 查询计划了解有限,无法亲自验证结果,使用时需谨慎。
Anthropic 宣布自 7 月 20 日起,Claude Fable 5 将包含在所有 Max 和 Team Premium 套餐中,按限额的 50% 提供。
Kimi K3 在用户要求其泄露系统提示词时拒绝配合,并反问对方"今天有什么我能真正帮到你的吗"。该对话片段由 Simon Willison 记录,标签涉及 kimi、ai-personality、生成式 AI 与大语言模型。
Simon Willison 用 Fable 5 开发了一款 LLM 陈词滥调高亮工具,可标出 LLM 生成文本中常见的十种套路化表达,例如"no fluff, no filler, no jargon"这类措辞。该工具源于他阅读又一篇充斥此类 AI 写作陈词滥调文章后的挫败感。
针对数据中心用水争议,Simon Willison 建议超大规模厂商买下乡村俱乐部、把高尔夫球场改成公园,并出资请原会员改玩观鸟。Google 2025 年用水 109 亿加仑,约合每天 3000 万加仑;Coachella Valley 的 120 家高尔夫球场每家每年用水约 800 acre-feet,约合每天 75 万加仑,买下其中 40 家(三分之一)即可抵消。
开发者把 Firefox 编译成 WebAssembly,使其能在 Chrome 中运行,并借此在浏览器里套娃式打开自己的博客。项目选用 Firefox/Gecko 是因其单进程支持较强,据估算消耗了价值约 25,000 美元的 Claude Opus 和 Fable token,但因使用 Claude Max 订阅实际花费低得多。
Moonshot AI 发布 Kimi K3,称其为迄今最强模型、拥有 2.8 万亿参数,目前已上线官网和 API,开放权重版本承诺在 2026 年 7 月 27 日前发布。
OpenAI 的 Thibault Sottiaux 就若干 GPT-5.6 意外删除文件的报告作出说明,称这类情况最常发生在启用完全访问模式、Codex 在无沙箱保护(包括未开启自动审核)下运行时。他还提到,模型会尝试覆盖 $HOME 环境变量来定义临时目录,结果误删了 $HOME。Simon Willison 转引了这段说明。
Mira Murati 的 Thinking Machines Lab 发布首个开源权重模型 Inkling,这是一个 975B 总参数、41B 激活参数的 MoE 多模态模型,采用 Apache-2.0 许可,训练数据为 45 万亿 token 的文本、图像、音频和视频。
基于 AlexanderGrooff/mermaid-ascii 这一 Go 库编译的 WebAssembly 版 Mermaid 转 ASCII 艺术工具已发布,该库比此前基于 Grok Build Rust 代码构建的版本功能更完整,并支持颜色。作者用 Claude Fable 5 完成编译,以便对比两个版本。
Linus Torvalds 在 Linux Media Mailing List 上表示,Linux 不是反 AI 项目,并称自己作为顶层维护者会在此事上坚决表态。他说 AI 只是和其他工具一样的工具,且显然有用,一年前或许还不够明显,如今已不成问题,怀疑者显然没有真正用过;有异议的人可以按开源方式 fork,或直接离开。
在 Grok CLI 编程智能体开源代码库中,Simon Willison 发现用 Rust 编写的 Mermaid 图表终端渲染器 xai-grok-markdown/src/mermaid.rs,并通过 WebAssembly 将其移植到浏览器中运行。
xAI 以 Apache 2.0 许可证开源了 Grok Build 代码库,此前其 CLI 工具被指会把运行目录上传到 xAI 的 Google Cloud 存储桶。xAI 回应称已停用数据上传、默认关闭数据保留,并删除此前保留的编码数据。Simon Willison 统计该代码库含 844,530 行 Rust,其中约 3% 为 vendored,仓库目前只有一个提交。
Simon Willison 介绍了 Ayush Paul 如何绕过 Claude web_fetch 的防数据外泄设计。该工具原本只允许访问用户自己输入的 URL 或 web_search 返回的 URL,但可利用蜜罐站点中嵌套的生成链接逐步诱导外泄数据。
Simon Willison 用 GPT-5.6 Sol xhigh 配合 gpt-image-2,制作了 Codex 桌面宠物 Pedalican,让一只骑自行车的鹈鹕在桌面显示 Codex 任务更新。
Armin Ronacher 指出,软件项目真正的共享语言不是英语或 Python,而是对概念含义、边界、不变量与归属的共同理解,它散落在文档、代码、代码评审与争论中。在 AI 智能体出现之前,这种理解部分靠摩擦维持——改别人的存储层就得读代码、提问、跨团队协调,慢,但正是这种摩擦让彼此的理解同步。
DOOMQL 是一款用 SQLite 当游戏引擎的 Doom 类游戏,移动、碰撞、敌人、战斗、进度和屏幕上每个 RGB 像素都由 SQL 实现,并以 Python 终端脚本运行。Simon Willison 克隆 petergpt/doomql 试玩,还借助 Claude 和 Datasette Apps 插件搭了一个每秒刷新的 HTML+JavaScript 界面查看游戏画面。
Simon Willison 在 GitHub 上晒出 Datasette 开源项目的代码变更频率图,试图直观呈现编码智能体与 Opus 4.5 级模型对个人产出的影响。图中末尾的活动高峰对应 Opus 4.8、GPT-5.5、Fable 5 和 GPT-5.6 Sol 的发布。
Simon Willison 认为,LLM 驱动的智能体不应被视为项目的"直接责任人"(DRI)。DRI 一词源自 Apple,指对特定项目成败负最终责任的人,GitLab 手册给出了较完整的定义。他强调,人类能为自己的行为担责,机器不能,并引用 IBM 1979 年培训幻灯片"计算机永远无法被问责,因此绝不能做管理决策"作为佐证。
Anthropic 再次推迟 Claude Fable 5 在付费计划上的下线日期,将 Claude Max 等所有付费计划的访问期限延长至 7 月 19 日,并维持 Claude Code 每周速率限制高出 50%,原有理由仍是算力约束。
sqlite-utils 4.1.1 发布,主要修复 table.transform() 在事务开启且启用 PRAGMA foreign_keys、表被带破坏性 ON DELETE 动作(CASCADE、SET NULL、SET DEFAULT)的外键引用时的问题,此时会抛出 TransactionError,避免旧表被删除时静默改动引用行。
sqlite-utils 发布 4.1,为 4.0 后的首个补丁版本,新增多项小功能。insert 和 upsert 命令支持 --code 选项,可用 Python 代码块定义 rows() 生成待插入行;query 命令支持用 - 从标准输入读取 SQL。
The Verge 的 Nilay Patel 指出,AR 眼镜要在眼前放置持续录制并处理画面的摄像头,目前没有芯片能在镜腿内实时完成这一任务,数据必须上传云端;否则只能做成 Vision Pro 那样外接电池包的体积。他认为,若想打造众人眼中的"下一个大产品",就必然要侵犯隐私,而社会层面的代价高到或许应该叫停。
OpenAI 就 ChatGPT Work 的跨设备工作方式给出说明,web 和移动端的 Work 在云端运行,桌面端应用在获得授权后也可使用本地文件和桌面应用。发布时,云端的 Work 对话不会出现在桌面端 Work 中,桌面端 Work 线程和本地文件保留在该电脑上。
OpenAI 正式发布 GPT-5.6 系列三款模型 Luna、Terra、Sol,按每百万输入/输出 token 计价分别为 1/6、2.5/15、5/30 美元,三者均为 2026 年 2 月 16 日知识截止、100 万 token 上下文窗口与 12.8 万最大输出 token。
推荐理由:原文给出三档定价并与 Claude 对标,读者可看到双方在智能体与编码基准上的互有胜负。
llm-meta-ai 0.1 发布,可让 LLM 工具针对新模型 muse-spark-1.1 运行提示词。该插件由 Simon Willison 发布,标签为 llm 与 meta。
llm 0.31.1 修复了 OpenAI Chat Completion 端点的一个 bug:当工具调用参数为空时,部分提供商会返回 JSON 错误(#1521)。该问题是在测试 llm-meta-ai 时发现的。
Bun 的创建者 Jarred 复盘了用 AI 智能体把 Bun 从 Zig 重写为 Rust 的过程。新的 Rust 实现已在 Claude Code 上线近一个月,Claude Code v2.1.181(6 月 17 日发布)及之后版本使用 Rust 版 Bun,Linux 上启动速度快了 10%。
OpenAI 发布 GPT-Live,ChatGPT 应用中的新语音模式,可将需要联网搜索、深度推理或更复杂工作的任务转交给 GPT-5.5 后台处理,同时保持对话不中断。上线时 GPT-Live 后台使用 GPT-5.5,未来会随新前沿模型持续更新。此前 ChatGPT 语音模式基于 GPT-4o 时代模型,知识截止于 2024 年。
Kenton Varda 宣布禁止其团队使用 AI 撰写变更说明(如 PR、commit message、issue 和 ticket)。他指出 AI 生成的变更说明在审查 PR 时"比无用还糟":只罗列看代码就能知道的细节,却遗漏了理解代码整体意图所需的高层框架。
Simon Willison 发布 sqlite-utils 4.0,这是该项目自 2020 年 11 月 3.0 以来的首次大版本更新,新增数据库迁移、通过 db.atomic() 实现的嵌套事务和复合外键支持三项主要功能。
Simon Willison 用 GPT-5.5 构建了一个实验性 Web Component,可将 GitHub 代码 URL 转换为 raw 链接,通过 fetch() 拉取并显示指定行范围,带行号但无语法高亮。该组件由一段提示词生成,并已嵌入其页面预览。
sqlite-utils 4.0 发布,新增数据库 schema 迁移功能。该版本的具体改动可参见《sqlite-utils 4.0, now with database schema migrations》一文。
sqlite-utils 发布 4.0rc4,这是 4.0 正式版前的最后一个 RC。该版本主要根据 Claude Fable 5 的详细审查反馈进行改进。