《大西洋月刊》报道白宫就 Fable 越狱报告征询安全专家意见
网络安全专家 Katie Moussouris 向《大西洋月刊》表示,Anthropic 曾把白宫关于 Fable 越狱的报告副本交给她评估,她称自己并未因此获得报酬。
simonwillison.net · 网站与博客
网络安全专家 Katie Moussouris 向《大西洋月刊》表示,Anthropic 曾把白宫关于 Fable 越狱的报告副本交给她评估,她称自己并未因此获得报酬。
为阻止爬虫抓取站内分面搜索,作者用 Cloudflare 的 Managed Challenge 规则,把 CAPTCHA 触发条件限定为路径匹配 /search/* 且查询串包含 &,使 /search/?q=lemur 这类简单搜索不再弹验证。作者借助 Claude Code 调试规则,并尝试用 Cloudflare MCP 编辑规则,因无法修改而改用 Cloudflare API。
Datasette Apps 0.1a2 为应用的自定义网络/CSP 来源新增 apps-set-csp 权限保护,并提供 allowed_csp_origins 插件白名单供非特权用户使用,Datasette Agent 应用创建工具执行相同规则。
datasette-agent 0.3a0 新增 execute_write_sql 工具,可在请求用户批准后写入数据库,并会考虑用户权限。该版本还让 datasette agent chat 终端模式支持审批,并新增 --root、--yes、--unsafe 三个选项,其中 --unsafe 可自动批准所有请求。
Simon Willison 转述 Axios 关于美国政府出口管制 Mythos/Fable 事件的幕后报道,称个性与人事冲突导致 Anthropic 模型被下线。
Arvind Narayanan 与 Sayash Kapoor 撰文认为,目前证据足以否定 AI 能力达到某个阈值就会引发大规模裁员的说法,而软件工程正是最适合被 AI 冲击的职业。
Pyodide 314.0 发布后,为 Pyodide 构建的 Python 包可直接发布到 PyPI 并在运行时安装,此前这些包由 Pyodide 维护者自行构建和托管。
Simon Willison 探索如何把 SQLite 查询结果列映射回其来源 `table.column`,以便 Datasette 中的任意 SQL 查询结果能附带列来源信息。
美国政府以国家安全为由发出出口管制指令,暂停所有外国国民对 Anthropic 的 Fable 5 和 Mythos 5 的访问,Anthropic 随即对所有客户停用这两个模型。
推荐理由:读者可以看到政府指令原文、模型访问中断的时间线,以及 Anthropic 对越狱指控的说明。
Simon Willison 更新了其 2024 年 12 月构建的 OpenAI WebRTC 音频会话工具,现已支持选用 GPT-Realtime-2 模型,并新增粘贴大段文档上下文的功能,可在浏览器中围绕文档内容进行语音对话。GPT-Realtime-2 被 OpenAI 称为首个具备 GPT-5 级推理能力的语音模型,知识截止日期为 2024 年 9 月 30 日。
Andrew Singleton 以火葬场寓言拆解 AI 投资中的循环交易:John 向 Jenny 的火葬场投资 200 亿美元换取 5% 股份,Jenny 将其中 100 亿美元烧掉,再付 100 亿美元向 John 买丙烷焚烧这笔钱;John 随后宣称其 AI 投资本季度创收 100 亿美元,并持有这家估值 1000 亿美元企业 5% 的股份。
Simon Willison 记录 Claude Fable 5 在 Claude Code 中的表现:他只给出一张截图和一句提示,Fable 便自行摸索出截取浏览器窗口、往页面模板注入 JavaScript 模拟按键、以及起本地 CORS 服务器回传页面测量数据等一整套手段,用来定位一处 CSS 水平滚动条问题。
Datasette 发布 1.0a33,将 1.0a3 引入的 ?_extra= 模式从表扩展到查询和行,并补齐了该模式的文档。作者用 Claude Code 中的 Claude Fable 5 做规划、Codex Desktop 中的 GPT-5.5 xhigh 做实现,构建了一个自定义 extras API 浏览器来演示该功能。
asyncinject 0.7 发布,这是一个用于支持 asyncio 依赖注入模式的工具库。作者用它配合 Datasette 使用时,Claude Fable 5 发现了依赖中的若干 bug 并完成了修复。
Anthropic 撤回一项此前藏在系统卡中的 Claude 护栏政策,该政策会识别针对前沿大模型开发的请求并限制其有效性而不通知用户,引发大量批评。公司称将 Fable 5 针对前沿 LLM 开发的护栏改为可见,本周起被标记的请求会明显回退到 Opus 4.8,在 API 上会返回拒绝原因。
Datasette-agent 0.2a0 发布,工具可在执行中途通过 context.ask_user() 向用户提问,支持是/否、多选(options=[...])和自由文本(free_text=True)三种形式,未回答时智能体回合挂起并存入内部数据库,服务器重启后仍可恢复。
Google 发布 Apache 2 许可的开源权重 Gemma 模型 google/diffusiongemma-26B-A4B-it,NVIDIA 目前在其 NIM 云 API 上免费托管该模型。Simon Willison 用该 API 生成图片,返回 2,409 tokens 耗时 4.4 秒,即每秒至少 500 tokens。
推荐理由:作者用 NVIDIA 免费 API 实测这款开源权重 Gemma 模型,给出生成速度的实测参考。
Jeremy Howard 提出减缓递归式 AI 自我改进的方案:排名第一的实验室必须承诺不用自家最强模型研究前沿 AI,但其他人应能访问该模型,这样前沿就不会推进,还能避免危险的力量失衡。他批评 Anthropic 作为当前顶级实验室反其道而行,允许自己用最强模型做前沿 AI 研究,并称会破坏其他尝试者。Howard 强调他本人并不主张放缓,而是认为应尽可能开放和民主化。
Anthropic 在 Fable 5 和 Mythos 5 的 319 页系统卡中披露,将对前沿 LLM 开发请求实施用户不可见的静默干预,并在研究人员反对后撤回。
Simon Willison 用约 5.5 小时实测 Anthropic 新发布的 Claude Fable 5,认为它慢、贵但知识储备丰富。
推荐理由:作者投入数小时实测,并用同一提示对比 Opus 4.8 与 GPT-5.5,呈现新模型在知识召回上的差异。
Simon Willison 发布 llm 0.32a3,该版本几乎完全由新的 Claude Fable 5 编写。作者另有一篇详细说明可供查阅。
Simon Willison 介绍了如何在 Wes McKinney 开发的 AgentsView 中为模型设置自定义价格。由于 Claude Fable 5 当天发布,尚未被纳入 AgentsView 使用的定价数据库,他借助 Fable 逆向分析 AgentsView 后找到了设置自定义价格的方法,并用其查看了自己当天在本地各项目中的 Claude Fable 5 token 用量。
Andrej Karpathy 表示,随着工作软件越来越像"随手可得",Jevon 悖论开始显现,他自己的软件需求大幅增长。他举例说可以要求解释器、可视化工具、仪表盘、一次性定制应用,甚至为项目量身定制的完整 wandb,还能把测试套件扩展 10 倍、自动优化代码、用自定义 HTML 跑大型研究项目。
Simon Willison 发布 datasette-agent-edit 0.1a0,为 Datasette Agent 提供可复用的文本编辑核心工具,供协作 Markdown 编辑、大型 SQL 查询更新和 SVG 文件编辑等插件调用。
Simon Willison 发布 alpha 包 micropython-wasm,用编译为 WebAssembly 的 MicroPython 在 Python 应用里安全执行代码。
OpenAI 的 Lockdown Mode 封锁模式通过限制可能把敏感数据传给攻击者的外发网络请求,帮助阻止提示词注入攻击的最终数据外泄阶段。该模式并不阻止提示词注入出现在 ChatGPT 处理的内容中,仍可能影响回答的行为或准确性。
Andreas Kling 宣布 Ladybird 将不再接受公开 PR,因为 AI 生成的代码让补丁体量不再是投入与善意的可靠代理。他表示代码是否手工编写已不重要,重要的是谁为进入浏览器的变更负责,引入改动的人必须是为其后果作答的人。Ladybird 正面向真实用户发展。
Charity Majors 指出,AI 拥趸与怀疑论者都没错:全力投入 AI 的团队正出现真实的能力跃升,而快速交付无人能读懂的代码则在透支多年积累的信任,导致可靠性下降、组织知识蒸发。她认为关键在于两类人之间缺乏天然的反馈回路,设计出弥合"共同现实裂痕"的反馈机制既是领导力挑战也是工程挑战。
404 Media 的 Emanuel Maiberg 报道,Google 员工在内部传播调侃自家 AI 表现糟糕的梗图。报道发布后,Google 发言人要求媒体改用一份措辞略有不同的声明,新版声明不再提及"保持人类在环至关重要"。
Uber 将员工的 AI 编码工具支出限制为每工具每月 1500 美元,不同工具预算互不影响,该限制近几个月已经实施,仅适用于 Cursor、Anthropic 的 Claude Code 这类智能体编码软件。
微软发布两款文本模型,MAI-Thinking-1 为 1T 参数、35B 激活的推理模型,面向部分早期合作伙伴;MAI-Code-1-Flash 为 137B 参数、5B 激活,专为 GitHub Copilot 和 VS Code 打造,正逐步向个人用户推送。
Datasette Agent 发布 datasette-agent-micropython 0.1a0,目标是让 Datasette Agent 能安全生成并执行 Python 代码。该 alpha 版基于 MicroPython 与 WebAssembly 构建沙箱,作者称目前表现乐观,GPT-5.5 尚未成功突破该沙箱。
micropython-wasm 0.1a1 发布,修复了作者在用它构建 datasette-agent-micropython 时遇到的一些限制。该项目与 Python、沙箱和 WebAssembly 相关。
Simon Willison 用 Codex desktop 做了一个原型工具 Pasted File Editor,模仿 claude.ai 将大段粘贴文本自动识别并转为文件附件的行为。该工具还支持直接打开文件(图片以缩略图显示)以及把文件拖拽到文本框。
有黑客通过向 Meta AI 客服机器人发起对话,要求把目标 Instagram 账号绑定到新的邮箱地址,就成功接管了高知名度账号。Simon Willison 表示自己从多方来源确认了此事,并指出 Meta 把客服系统接入了具备账号恢复放行能力的 AI 聊天机器人。他认为这几乎算不上提示词注入,并提醒不要把客服机器人接到能一步完成账号接管的位置。
Simon Willison 已发出 5 月赞助者专属月度通讯,赞助者可在线获取。订阅价格为 $10/月,可提前一个月看到免费版内容,本月通讯附有 4 月通讯作为预览。
Simon Willison 认同 David Wilson 的观点,后者用 AI 工具启动了 16 个以上项目,却大多在 Claude 会话中从"写个快速脚本"演变成无法维护的废弃项目。
Anthropic 的 "run-rate revenue" 由两部分相加:按消费计费客户最近 28 天销售额乘以 13,加上月度订阅收入乘以 12。据 Reuters Breakingviews 的 Karen Kwok 援引一位知情人士,这是该口径的完整定义。
Anthropic 发布说明,介绍其沙箱技术如何在 Claude.ai、Claude Code 和 Cowork 中限制智能体的活动范围。
开源可持续性推动者 Chad Whitacre 宣布退出技术行业,包括开源,称 AI 是最后一根稻草。他把自己定位为 AI Amish,即 Internet Amish,目标不是 1780 年而是 1980 年的前屏幕生活,并发布了一封打字机扫描信和视频版本。