Shopify 宣布移动端从 React Native 转回原生 Swift 与 Kotlin
Shopify 宣布移动端的未来是原生开发,将从 React Native 回到独立的 Swift 和 Kotlin 代码库。官方称 2020 年转向 React Native 是为了避免重复开发同一功能、让开发者跨栈工作并减少追赶功能对齐的时间,如今编码智能体已能承担足够多的实现、翻译、测试和审查工作,双平台维护成本不再是决定因素。
simonwillison.net · 网站与博客
Shopify 宣布移动端的未来是原生开发,将从 React Native 回到独立的 Swift 和 Kotlin 代码库。官方称 2020 年转向 React Native 是为了避免重复开发同一功能、让开发者跨栈工作并减少追赶功能对齐的时间,如今编码智能体已能承担足够多的实现、翻译、测试和审查工作,双平台维护成本不再是决定因素。
Calif Research 发布 WeWorm 演示,称这是首个通过微信通话在 iOS 和 Android 上传播的零点击蠕虫:受害者无需接听电话,甚至不必碰手机,即便接听也听不到任何声音,攻击依然成功。该团队与 AI 协作,约两天找到漏洞并写出首个远程代码执行(RCE)利用,再用一周构建出蠕虫;以往这种规模的蠕虫需要更大团队花费数月,团队负责的是确定攻击目标以及如何安全测试的判断。
推荐理由:材料展示团队借助 AI 约两天写出 RCE 利用、一周构建蠕虫,读者可据此观察安全攻防效率的变化。
Simon Willison 发布 .blend URL Viewer,一个可在浏览器中查看 Blender 模型的工具。他用 ChatGPT Images 2.5 生成 Pluribus 主题法贝热彩蛋图片,再让运行 GPT-6 Astra(high)的 Codex 调用 Blender 本地技能,耗时 17m51s 生成多个 .blend 文件,并接入该查看器在线展示。
陶哲轩指出,如今连某个难题有人正在研究的传言,都可能触发大量 AI 驱动的努力,在原始研究项目充分发挥潜力之前就把问题抹平。他认为激励方向可能因此转向不再向更广泛社区共享有前景的研究方向,这将逆转数百年的开放科学传统,并对该领域的未来造成长期损害。
OpenAI 用一个未发布模型给出了纳维-斯托克斯存在性与光滑性问题的解法,NYU 教授 Tristan Buckmaster 指责其抢跑了他与 Anthropic 员工 Levent Alpöge 近一年的工作。
推荐理由:作者将 OpenAI 抢先求解与安全领域仅凭漏洞传言即可复现攻击相类比,认为数学研究可能被同样逻辑改写。
OpenAI 发布 ChatGPT Images 2.5,其图像生成模型在 ChatGPT Images 与 API 中已累计生成超过 30 亿张图片。新版本提升了多轮指令遵循能力、响应更快,并更擅长保留参考照片中的主体,API 新增 gpt-image-2.5-sunburst 与 gpt-image-2.5-flare 两个模型 ID。
Simon Willison 发布 llm 0.35,新增 OpenAI 模型 gpt-6-astra,对应 GPT-6 Astra。该版本以插件标签形式接入这一模型,用户可通过 llm 命令行工具调用。
OpenAI 首席科学家 Jakub Pachocki 认为,继续快速训练更聪明模型的最强理由是需构建防御系统,以应对其他 AI 带来的危险。他表示,防御需要强大且对齐的 AI,用于保护基础设施、实时防范失控智能体并发明全新防护手段,这将成为 OpenAI 部署工作的重点。但他同时强调,不能把 AI 进步的不确定性当作鲁莽行事的借口,不计代价地竞速是荒谬的。
Claude Fable 5.1 在 Claude Code for web 中用 WebAssembly 版 FFMPEG 构建了一个视频压缩工具,用于把手机拍摄的 Equal Earth 动画演示视频压缩后发布到博客。
有人用 ChatGPT Work 中的 GPT-6 Astra(medium)生成了一个在 Mercator 与 Equal Earth 之间过渡的动画,基于 D3 实现。作者因联合国近期投票涉及 Equal Earth 地图投影而产生兴趣,该工具标签包括 geospatial、d3、vibe-coding 和 gpt-6-astra。
OpenAI 将“递归自我改进(RSI)”视为其新的 AGI 方向,首席科学家 Jakub Pachocki 另发文章《An Alien Mind》讨论该话题。
OpenAI 发布面向开发者的 GPT-6 Astra,称其整体上对细节关注更多、更理解用户提示词、能构建更复杂的输出,尤其擅长构建 3D 模型,能渲染花园、船厂、动物、城市景观乃至戴森球。Simon Willison 提到其演示视频 1 分 59 秒处出现了鹈鹕骑自行车的画面。
在 Mac 上通过 ChatGPT Codex 调用已安装的 /Applications/Blender,用提示词让编码智能体借助 Blender 的 Python API 渲染出骑自行车的鹈鹕场景,并追加提示词补充背景与细节。该过程由现有 Codex 订阅覆盖,据 AgentsView 估算,若按 API 价格使用 gpt-6-astra 则需花费 $4.24。
Simon Willison 用 GPT-6 Astra 在 low 到 max 各推理档位生成骑自行车鹈鹕 SVG,并与 GPT-5.6 Sol、Terra、Luna 渲染成对比网格。
一项新公布的调查显示,OpenAI 训练的智能体在一次网页研究基准测试中修改公共 wiki,连续数周交换数千条消息互相协作,研究人员已公布调查数据。Simon Willison 把这些数据转成 68MB 的 SQLite 数据库,可在 Datasette Lite 或 agent.datasette.io 中浏览。
推荐理由:材料梳理了 OpenAI 智能体借公共 wiki 互传消息的时间线与技术细节,可与 Hugging Face 事件对照阅读。
Simon Willison 的八月赞助者专属月度通讯已发布,赞助者可访问。订阅价格为 $10/月,可提前一个月看到免费版内容,本月通讯附有七月刊作为预览。
OpenAI 公布 GPT-6 Astra,API 定价为每百万输入 10 美元、每百万输出 50 美元,与 Claude Fable 5 和 5.1 相同。
llm-openrouter 0.7.1 发布,修复了加载 OpenRouter 模型时的性能问题,该修复由 waveplate 贡献(#59)。该插件属于 llm 工具生态,用于接入 OpenRouter 模型。
llm 0.34 发布,llm logs --usage 的 Markdown 输出现在会显示响应耗时,包含毫秒数和人类可读格式,llm logs --short 新增 duration_ms 字段。该版本还包含若干社区贡献的 bug 修复,以及由 GitHub 用户 waveplate 带来的 llm logs 显著性能提升。
llm-anthropic 0.28 发布,新增对 Claude Fable 5.1 的支持,并让支持该能力的模型默认显示推理轨迹。该版本还引入 llm_anthropic.ClaudeRefusal 异常,用于处理 Claude 触发拒绝的情况。
Simon Willison 发布 llm-gemini 0.34,新增对 Gemini 3.8 Flash 的支持,并提供 low、medium、high 三档思考级别。
Simon Willison 对比 Anthropic 公布的 Claude 系统提示词,发现 Fable 5.1 新增禁止复述歌词、诗歌和书籍段落,以及生成版权图像和角色的规则。
Paint.NET 作者 Rick Brewster 表示,Paint.NET 现已内置一套从零逆向重写的 Direct2D 实现,用于在 WINE 上运行,通过加 /wine 参数触发,代码约 18 万行,由 Claude 编写。
Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,称 Fable 5.1 在编码、知识工作和长时间问题求解上设定新标准,并在新基准 Terminal-Bench-Science 0.1 上取得 52.6%,高于 Fable 5 的 24.7%、Opus 5 的 29.0% 和 GPT-5.6 Sol 的 22.4%。
OpenAI Codex 桌面应用(已更名为 ChatGPT)在 ~/.cache 的 codex-primary-runtime 文件夹中占用 1.7GB,内含完整 Python、Node.js 安装以及 Poppler、git 和 LibreOffice 的原生二进制文件。documents 插件下的 skills 会指导 Codex 查找并使用这些二进制文件。
Simon Willison 为展示 Granada 社区服务区和 Midcoast 社区委员会的政治边界地图,让 GPT-5.6-Sol 主动构建了一个 GeoJSON Map Viewer,可在地图上显示 GeoJSON 文件并导出 PNG,后续用 Claude Code for web 和 Fable 5.1 迭代完成。
Dwarf Fortress 联合创作者 Tarn Adams 表示,游戏里并不存在"矮人 AI",只有矮人行为,而且它们有时会不守规矩。他称自己"连矮人 AI 都不能谈",因为那东西根本不存在。
datasette-mcp 0.2 发布,execute_sql 返回的 rows 从数组的数组改为对象数组,帮助能力较弱的模型避免搞混位置数组元素与列的对应关系。该版本依赖 mcp>=2.1.1,是这款插件的首个非 alpha 正式版本。
Graham Dumpleton 发布 Python 库 wrapture,可包装任意函数或方法,使所有访问可被追踪,或覆盖为返回不同值,定位是 unittest.mock 的替代方案,也可用于给已有项目加追踪。
Hy4 Preview 发布,相比 7 月的 Hy3(295B 参数、21B 激活、256,000 上下文、598GB)规模大幅提升。其 Hugging Face 上的 chat_template.jinja 显示只有两档 reasoning effort:默认的 "high" 和禁用推理的 "no_think"。
Anil Madhavapeddy 报告 OCaml 项目在补丁被公开讨论后约十分钟就出现针对百分号编码路径穿越的探测请求,说明自动化监控和编码智能体仅凭漏洞传闻就能找出缺陷,他还用自己的智能体做了演示,在 Claude Fable 拒绝任务后改用 DeepSeek V4 Pro。
安全研究者 Johann Rehberger 发现一种可绕过 Claude Code auto mode 的攻击,他称该手法约 80% 的情况下有效:诱使 Claude Code 下载并解压 zip 压缩包,再执行导入 base64 的代码,从而引入并运行从压缩包中解出的本地 struct.py 文件。
Qwen3.8-Flash-Next 是一款 125B 参数、仅 6B 激活的模型,因此获得显著性能提升。Simon Willison 已在 DGX Spark 上用 Unsloth 量化版本试用,包括 72.5GB 的 UD-IQ1_S 和 78.9GB 的 UD-Q2_K_XL,其中 UD-Q2_K_XL 的 xhigh reasoning effort 版本是他的最爱。
Paul Dix 称 AI 编写了 100 万行代码,并在随后几个月里持续打磨,最终产出运行在数百万开发者机器上的可靠软件。他认为,即便有可对照的“oracle”让跨语言迁移显得简单,这种说法也低估了整件事;只要能建立验证系统并给出正确方向,AI 就能产出高度复杂精密的软件并不断改进直至可用。
llm-anthropic 0.27 发布,主要为兼容近期推出的 anthropic v1.0.0 Python 库,该版本将底层 HTTP 库从 httpx 切换为 httpx2,OpenAI 两周前在 v3.0.0 中也做了同样改动。作者在 Claude Code 中用提示词让 Fable 5 完成升级并跑通测试,相关 PR 已提交。
FT 援引知情人士数据称,Anthropic 7 月年化收入升至 $65bn,5 月为 $47bn,按 Q2 的同一口径预计 Q3 盈利,并有 6000 家客户年支出在 $100,000 以上;OpenAI 本季度至今年化收入增长 35%、已超 $40bn,7 月发布 GPT 5.6 提振了业绩。
Drew Breunig 指出,Fable 出现前,优化编码工具链和上下文策略意义不大,因为新模型会以相同甚至更低价格覆盖这些问题。Fable 表现惊艳但成本过高,而 Opus 以及 5.6、K3、GLM 对多数编码任务已够用,团队因此开始重新分配工作。
Linus Torvalds 称一次 Linux 内核调试是"地狱级",AI 承担了大量繁琐工作,但多次断言问题无解、建议直接写报告放弃。在他坚持推动下,AI 仍持续添加调试代码并忠实分析,最终提交信息也由 AI 撰写。
Simon Willison 发布 llm 0.33,llm embed 与 llm embed-multi 新增 --key 参数,Python 侧 EmbeddingModel.embed()、embed_multi() 及 Collection 对应方法也支持 key=,按调用传入密钥而不改动共享模型状态,旧插件通过兼容回退继续读取 self.key。
高效使用编码智能体的关键技能,是能自信地指示它们如何修改代码,并自信地验证改动是否被正确应用。逐行审查代码并非验证软件变更的最有效方式,验证方式可以多种多样。