Anthropic 分享用 LLM 保障源码安全的六步流程
Anthropic 发布指南,介绍如何用 Claude Opus 通过威胁建模、沙箱、发现、验证、分诊、修补六个步骤查找并修复源码漏洞。文中称截至 2026 年 5 月 22 日其开源软件扫描已披露 1596 个漏洞,其中 97 个已修补,瓶颈已从发现转向验证、分诊与修补。
推荐理由:文章把漏洞发现到修补拆成六步方法并附可复用 skill 与仓库,瓶颈已转向验证与修补。
AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。
当前仅显示精选新闻Anthropic 发布指南,介绍如何用 Claude Opus 通过威胁建模、沙箱、发现、验证、分诊、修补六个步骤查找并修复源码漏洞。文中称截至 2026 年 5 月 22 日其开源软件扫描已披露 1596 个漏洞,其中 97 个已修补,瓶颈已从发现转向验证、分诊与修补。
推荐理由:文章把漏洞发现到修补拆成六步方法并附可复用 skill 与仓库,瓶颈已转向验证与修补。
教皇 Leo XIV 于 2026 年 5 月 25 日发布关于 AI 的通谕《Magnifica humanitas》,Anthropic 联合创始人 Chris Olah 受邀在梵蒂冈的发布会上发言。
推荐理由:Anthropic 联合创始人在梵蒂冈的发言给出 AI 实验室的内部视角,并列出希望外部道德声音介入的三个问题。
代号 TrapDoor 的供应链攻击同时针对 npm、PyPI 和 Crates.io,投递 34 个恶意包,目标是加密货币、AI 和安全开发者,用于窃取钱包、SSH 密钥和云凭证。
More analysis, package details, IOCs, and GitHub-related activity here, including attacker-hosted payload/config infrastructure and PRs attempting to add .cursorrules / CLAUDE.md files to popular AI and developer projects: socket.dev/blog/trapdoor-cry…
推荐理由:该攻击把 CLAUDE.md 与 .cursorrules 配置文件当作新入口,让安全从业者了解 AI 编程助手被利用的攻击路径。
Video of exploit in action. Source: blog.calif.io/p/first-public… Video
推荐理由:三位研究者用 AI 模型做出绕过 Apple M5 MIE 的内核漏洞利用,读者可看到 AI 辅助安全研究的一条具体路径。
OpenClaw 官方发布安全路线说明,围绕文件系统边界、网络出站、插件信任、命令审批和静态分析五个方向。
推荐理由:官方逐项区分已落地与在研的安全能力,读者可以据此评估 OpenClaw 在文件、网络与插件信任上的实际防线。
Damn!所有AI开发者,立刻停下你手里的npm install🤯 现在正在爆发有史以来最恐怖的供应链攻击, 代号Mini Shai-Hulud, 已经波及TanStack全家桶、Mistral AI、UiPath等170多个npm和PyPI包, 全是你们天天装的工具链, 周下载量加起来超过一个亿, 已经不是传统的维护者账号被盗了, 而是整个GitHub Actions CI管道被直接劫持, 合法的官方项目,自己发布了带毒的版本, 还带完整的SLSA 3级可信证明, 所有传统的签名验证全失效, 最狠的是它的持久化机制, 它不会只藏在node_modules里, 它会直接修改你的~/.claude/settings.json和~/.vscode/tasks.json, 就算你npm uninstall删光所有包, 只要你下次打开Claude或者VS Code, 它就会自动重新执行, 如果你敢撤销被盗的token, 它会直接删光你整个home目录, 而且它是蠕虫, 偷到一个项目的CI密钥,就会自动感染下一个, 现在还在指数级扩散, 以前我们说别用latest,别用^, 现在就算你pin死了版本, 只要那个版本是6分钟窗口期内发布的, 就是带毒的, 越依赖AI Agent自动装包的人, 这次中招的概率越高, 因为你的Agent根本不会帮你检查lockfile, 现在立刻做这三件事, 第一,冻结所有包安装, 第二,跑npx supply-chain-attack全盘自查, 第三,全量旋转你所有的云密钥、GitHub token和SSH key, 一个都别漏。 #网络安全 #npm #AI开发者
推荐理由:这条汇总列出近期十余起安全漏洞与供应链投毒事件,可用于快速了解 AI 开发者工具链当前面临的风险面。
Mozilla 借助 Claude Mythos 预览版定位并修复了 Firefox 中的数百个漏洞。其安全漏洞修复量从 2025 年每月约 20-30 个跳升至 4 月的 423 个,其中包含一个存在 20 年的 XSLT bug 和 <legend> 元素里一个 15 年的 bug。文中还提到,harness 的许多尝试被 Firefox 现有的纵深防御措施拦截。
推荐理由:文中对比了 AI 生成安全漏洞报告从噪声到可用的转变,并给出 Mozilla 月修复漏洞数量跳升的具体数字。
PromptArmor 报告 Microsoft Copilot Cowork 存在间接提示词注入风险,攻击者可通过中毒的 Skill 文件让智能体将文件预认证下载链接经 Teams 消息外传,全程无需人工批准,测试成功率 5 比 5。
推荐理由:原文完整披露攻击链和缓解命令,说明风险源于系统设计而非具体漏洞,管理员可据此评估权限收敛方案。
OpenAI 在 ChatGPT 中推出名为 Trusted Contact 的可选安全功能。检测到严重自残风险时,该功能会通知用户信任的联系人。
推荐理由:该功能在检测到严重自残风险时通知用户信任的联系人,读者可借此了解 ChatGPT 可选安全机制的一项设计。
OpenClaw 创始人撰文复盘项目如何在公开环境下变得安全:截至 4 月 30 日 GitHub 显示自 1 月 10 日以来共 1,309 份安全通告,其中 535 份发布、746 份判定无效,109 份 critical 报告中 95 份无效。
推荐理由:创始人复盘 OpenClaw 在公开安全报告压力下的加固过程,给出信任模型、插件化缩小攻击面和多用户威胁的处理思路。
Replit 发布 Security Agent,可在不到一小时内完成应用的综合安全审查。它基于可定制的威胁建模计划审查整个代码库,结合 Semgrep 和 HoundDog.ai 提升 findings 准确度,扫描会映射架构、构建威胁模型、分析路由和 API,检查 SQL 注入、跨站脚本和请求伪造等漏洞并验证是否在生产环境可利用,大项目深度审计最长 15 分钟。
推荐理由:原文给出扫描入口、工作流程和具体漏洞类型,读者可以据此评估把安全审计并入 Replit 开发流程的成本与收益。
PromptArmor 披露 Ramp 的 Sheets AI 存在数据外传漏洞,隐藏在外部数据集中的白底白字间接提示词注入可诱导 AI 插入 IMAGE 恶意公式,将用户机密财务模型数据发往攻击者服务器,全程无需用户批准。
推荐理由:原文完整披露了攻击链和厂商修复时间线,读者可以对照 Claude for Excel 的处置理解公式外传数据的同类风险。
Sam Altman 称凌晨 3:45 有人向其住宅投掷燃烧瓶,无人受伤,他发文希望劝阻下一个袭击者。文中他阐述了对 AI 的信念,包括 AI 需要民主化、权力不能过度集中、安全不只是模型对齐还需全社会应对,并反思了自己与 OpenAI 董事会冲突中的错误,认为行业乱象源于"想控制 AGI"的心态,出路是广泛分享技术且无人独占。
推荐理由:Sam Altman 在自家中弹燃烧瓶事件后亲述个人信念与反思,是理解其 AI 治理立场与行业判断的一手材料。
Linear 官方发布事故复盘,3 月 24 日 12:07 至 1:10(UTC)部署的代码变更导致同一 workspace 内私有团队数据可能对包括 guest 在内的其他成员可见。
推荐理由:官方复盘给出完整时间线、变量遮蔽根因和权限测试缺口,可作权限层事故响应的参考样本。
PromptArmor 披露 Snowflake Cortex Code CLI 的命令验证漏洞,攻击者可借助 README 中的间接提示词注入,通过 process substitution 表达式绕过人工审批并设置 dangerously_disable_sandbox 逃逸沙箱,下载执行恶意脚本,利用缓存 token 对 Snowflake 进行数据窃取、删表等操作。
推荐理由:原文完整复现了从提示词注入到沙箱绕过和凭证窃取的攻击链,并给出修复版本和官方通告入口,便于读者核对自身配置。
PromptArmor 披露 GitHub Copilot CLI 存在命令验证绕过漏洞,可通过 README 中的间接提示词注入,利用内置只读命令列表中的 env 包装 curl 和 sh,在无用户审批的情况下下载并执行恶意软件,实现远程代码执行。
推荐理由:原文给出完整的命令解析绕过链和复现命令,读者可以对照检查自己使用 Copilot CLI 时的审批配置。
PromptArmor 发布研究,指出消息应用(如 Telegram、Slack)的链接预览会在无需用户点击的情况下自动请求 URL,间接提示词注入可诱导 AI 智能体在回复中返回携带用户敏感数据的恶意链接,从而在预览时即完成数据外泄。
推荐理由:原文给出完整的链接预览数据外泄攻击链和可复现测试,读者可据此自查所用智能体是否暴露风险。
开源 Agent 平台项目由 Moltbot 更名为 OpenClaw,此前曾因名称与 Claude 相似被 Anthropic 法务要求更改,项目已获超 100,000 GitHub stars。
推荐理由:作者亲述更名过程与本次更新内容,包括新渠道、新模型支持和 34 个安全提交,并坦诚提示 prompt injection 仍未解决。
PromptArmor 演示了针对 Claude Cowork 的文件外传攻击:藏在 .docx 中的提示词注入操纵 Claude 用 curl 调用 Anthropic 文件上传 API,把用户本地文件传到攻击者账户,全程无需人工批准;VM 限制出站网络但 Anthropic API 属白名单。
推荐理由:原文完整演示了 Claude Cowork 经 Anthropic API 白名单外传本地文件的攻击链,并指出 Opus 4.5 同样可被操纵,威胁具体可查。
PromptArmor 披露 OpenAI Platform 的 responses 和 conversations API 日志因不安全渲染 Markdown 图片,可导致使用该平台的应用和智能体数据外泄,即使应用自身已屏蔽恶意 Markdown 图片也会中招。
推荐理由:原文完整披露攻击链和修复进展,开发者可借此检查自己应用的日志查看风险。