Sysdig 披露全球首例 AI Agent 自主完成的勒索软件攻击
Sysdig 威胁研究团队披露一起由 AI Agent 自主完成的勒索软件攻击,将该攻击者命名为 JADEPUFFER。
推荐理由:报告完整还原 AI Agent 自主串联漏洞利用到数据库加密的攻击链路,为评估自动化攻击风险提供了具体样本。
AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。
当前仅显示精选新闻Sysdig 威胁研究团队披露一起由 AI Agent 自主完成的勒索软件攻击,将该攻击者命名为 JADEPUFFER。
推荐理由:报告完整还原 AI Agent 自主串联漏洞利用到数据库加密的攻击链路,为评估自动化攻击风险提供了具体样本。
Anthropic 宣布 Claude Fable 5 重新部署并面向全球所有用户开放,同时公布其网络安全安全分类器的细节和一份 AI 越狱严重性框架草案。分类器把网络安全用途分为禁止使用、高风险双用途、低风险双用途和良性使用四类,分别对应拦截、监控或放行,并设有比以往模型更大的安全边界。
推荐理由:Anthropic 披露 Fable 5 安全分类器的四类用途边界,并提出按能力增益与可利用性打分的越狱危害评级草案。
美国以国家安全为由发布出口管制指令,禁止包括 Anthropic 外国籍员工在内的任何外国国民访问 Fable 5 和 Mythos 5,Anthropic 因此须对全部客户停用这两款模型,其他 Anthropic 模型不受影响。
推荐理由:原文给出政府指令的具体要求与 Anthropic 的回应依据,读者可了解前沿模型商用部署与监管尺度之间的争议点。
When Fable 5 is used for frontier LLM development, it does not notify the user and instead limits the model’s capabilities through methods such as prompt modification, steering vectors, and PEFT. Anthropic estimated that this would affect approximately 0.03% of traffic.
推荐理由:材料呈现模型在敏感领域被悄然降能的机制,可供观察厂商在能力与安全之间的取舍方式。
Anthropic 发布 Mythos 级模型 Claude Fable 5,并同期向少数网络安全与基础设施合作方开放解除部分安全限制的 Claude Mythos 5。
推荐理由:原文给出两款新模型的能力定位、分级开放方式与安全回退机制,可对照理解前沿模型的分层发布思路。
Anthropic 宣布把 Project Glasswing 扩展到约 150 家新机构,此前约 50 家初始合作伙伴已用 Claude Mythos Preview 扫描代码库、发现超过 10000 个高危或严重安全漏洞。
推荐理由:从约 50 家扩至约 150 家合作机构,呈现 AI 漏洞扫描在电力、水务等关键基础设施行业的落地路径。
OpenAI 封禁了一个疑似源自中国的账号集群,该集群使用 AI 生成社交媒体内容,批评美国的数据中心和 AI 基础设施。相关内容被归入名为 Data Center Bandwagon 的面向美国的影响力行动。
推荐理由:OpenAI 披露了一次针对其平台的 AI 影响力行动处置结果,读者可了解生成式内容被用于舆论操作的具体形态。
作者用 Opus 4.8 解读 Anthropic 发布的 200 页 System Card,报告绝大部分篇幅在讲安全问题,从生化武器制作、自残认同到思维链可观测性变弱和潜意识测试。
推荐理由:文中对照 Opus 4.7 与 4.8 的表现差异,呈现诚实度训练与模型被诱导、赚钱能力之间的取舍。
Anthropic 发布指南,介绍如何用 Claude Opus 通过威胁建模、沙箱、发现、验证、分诊、修补六个步骤查找并修复源码漏洞。文中称截至 2026 年 5 月 22 日其开源软件扫描已披露 1596 个漏洞,其中 97 个已修补,瓶颈已从发现转向验证、分诊与修补。
推荐理由:文章把漏洞发现到修补拆成六步方法并附可复用 skill 与仓库,瓶颈已转向验证与修补。
教皇 Leo XIV 于 2026 年 5 月 25 日发布关于 AI 的通谕《Magnifica humanitas》,Anthropic 联合创始人 Chris Olah 受邀在梵蒂冈的发布会上发言。
推荐理由:Anthropic 联合创始人在梵蒂冈的发言给出 AI 实验室的内部视角,并列出希望外部道德声音介入的三个问题。
代号 TrapDoor 的供应链攻击同时针对 npm、PyPI 和 Crates.io,投递 34 个恶意包,目标是加密货币、AI 和安全开发者,用于窃取钱包、SSH 密钥和云凭证。
More analysis, package details, IOCs, and GitHub-related activity here, including attacker-hosted payload/config infrastructure and PRs attempting to add .cursorrules / CLAUDE.md files to popular AI and developer projects: socket.dev/blog/trapdoor-cry…
推荐理由:该攻击把 CLAUDE.md 与 .cursorrules 配置文件当作新入口,让安全从业者了解 AI 编程助手被利用的攻击路径。
Video of exploit in action. Source: blog.calif.io/p/first-public… Video
推荐理由:三位研究者用 AI 模型做出绕过 Apple M5 MIE 的内核漏洞利用,读者可看到 AI 辅助安全研究的一条具体路径。
Damn!所有AI开发者,立刻停下你手里的npm install🤯 现在正在爆发有史以来最恐怖的供应链攻击, 代号Mini Shai-Hulud, 已经波及TanStack全家桶、Mistral AI、UiPath等170多个npm和PyPI包, 全是你们天天装的工具链, 周下载量加起来超过一个亿, 已经不是传统的维护者账号被盗了, 而是整个GitHub Actions CI管道被直接劫持, 合法的官方项目,自己发布了带毒的版本, 还带完整的SLSA 3级可信证明, 所有传统的签名验证全失效, 最狠的是它的持久化机制, 它不会只藏在node_modules里, 它会直接修改你的~/.claude/settings.json和~/.vscode/tasks.json, 就算你npm uninstall删光所有包, 只要你下次打开Claude或者VS Code, 它就会自动重新执行, 如果你敢撤销被盗的token, 它会直接删光你整个home目录, 而且它是蠕虫, 偷到一个项目的CI密钥,就会自动感染下一个, 现在还在指数级扩散, 以前我们说别用latest,别用^, 现在就算你pin死了版本, 只要那个版本是6分钟窗口期内发布的, 就是带毒的, 越依赖AI Agent自动装包的人, 这次中招的概率越高, 因为你的Agent根本不会帮你检查lockfile, 现在立刻做这三件事, 第一,冻结所有包安装, 第二,跑npx supply-chain-attack全盘自查, 第三,全量旋转你所有的云密钥、GitHub token和SSH key, 一个都别漏。 #网络安全 #npm #AI开发者
推荐理由:这条汇总列出近期十余起安全漏洞与供应链投毒事件,可用于快速了解 AI 开发者工具链当前面临的风险面。
Mozilla 借助 Claude Mythos 预览版定位并修复了 Firefox 中的数百个漏洞。其安全漏洞修复量从 2025 年每月约 20-30 个跳升至 4 月的 423 个,其中包含一个存在 20 年的 XSLT bug 和 <legend> 元素里一个 15 年的 bug。文中还提到,harness 的许多尝试被 Firefox 现有的纵深防御措施拦截。
推荐理由:文中对比了 AI 生成安全漏洞报告从噪声到可用的转变,并给出 Mozilla 月修复漏洞数量跳升的具体数字。
OpenAI 在 ChatGPT 中推出名为 Trusted Contact 的可选安全功能。检测到严重自残风险时,该功能会通知用户信任的联系人。
推荐理由:该功能在检测到严重自残风险时通知用户信任的联系人,读者可借此了解 ChatGPT 可选安全机制的一项设计。
Sam Altman 称凌晨 3:45 有人向其住宅投掷燃烧瓶,无人受伤,他发文希望劝阻下一个袭击者。文中他阐述了对 AI 的信念,包括 AI 需要民主化、权力不能过度集中、安全不只是模型对齐还需全社会应对,并反思了自己与 OpenAI 董事会冲突中的错误,认为行业乱象源于"想控制 AGI"的心态,出路是广泛分享技术且无人独占。
推荐理由:Sam Altman 在自家中弹燃烧瓶事件后亲述个人信念与反思,是理解其 AI 治理立场与行业判断的一手材料。
Linear 官方发布事故复盘,3 月 24 日 12:07 至 1:10(UTC)部署的代码变更导致同一 workspace 内私有团队数据可能对包括 guest 在内的其他成员可见。
推荐理由:官方复盘给出完整时间线、变量遮蔽根因和权限测试缺口,可作权限层事故响应的参考样本。
Microsoft AI 发布长文,提出 Humanist Superintelligence(HSI)理念,即面向具体领域、受控服务于人类的超智能,并宣布组建由作者领导的 MAI Superintelligence Team。
推荐理由:Microsoft AI 提出以人类为中心、领域受限的超智能路线,文中给出医疗诊断等具体方向和 containment 难题的判断。
Arvind Narayanan 发布超过 1.5 万字的新论文,提出将 AI 视为“常态技术”的世界观,认为其影响类似电力和互联网等通用技术,变革性经济与社会影响将以数十年为时间尺度缓慢展开。
推荐理由:作者提出 AI 是像电力一样的常态技术,经济影响将以数十年计缓慢扩散,并给出风险与政策的替代框架。
Sayash Kapoor 分析 WIRED AI Elections Project 收录的 78 个 2024 年选举 AI 使用案例,发现其中 39 个无欺骗意图,而 39 个欺骗性内容不用 AI 也能以几百美元内的成本复制。文章提出误信息的关键在需求侧而非供给侧,治理信息环境依赖结构性、制度性改变,而非限制 AI 生成内容。
推荐理由:作者基于 WIRED 数据库 78 个案例给出一手分析,指出政治误信息更多是需求侧的结构性问题,值得从供需视角重新审视。