跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

当前仅显示精选新闻
216条精选相关主题论文研究政策监管推理能力

最新精选

第 181–200 条 · 共 216 条
5月27日周三
  1. Claude Blog76

    Anthropic 分享用 LLM 保障源码安全的六步流程

    Anthropic 发布指南,介绍如何用 Claude Opus 通过威胁建模、沙箱、发现、验证、分诊、修补六个步骤查找并修复源码漏洞。文中称截至 2026 年 5 月 22 日其开源软件扫描已披露 1596 个漏洞,其中 97 个已修补,瓶颈已从发现转向验证、分诊与修补。

    推荐理由:文章把漏洞发现到修补拆成六步方法并附可复用 skill 与仓库,瓶颈已转向验证与修补。

5月25日周一
  1. @kimmonismus65

    代号 TrapDoor 的供应链攻击同时针对 npm、PyPI 和 Crates.io,投递 34 个恶意包,目标是加密货币、AI 和安全开发者,用于窃取钱包、SSH 密钥和云凭证。

    引用Socket (@SocketSecurity)@SocketSecurity

    More analysis, package details, IOCs, and GitHub-related activity here, including attacker-hosted payload/config infrastructure and PRs attempting to add .cursorrules / CLAUDE.md files to popular AI and developer projects: socket.dev/blog/trapdoor-cry…

    推荐理由:该攻击把 CLAUDE.md 与 .cursorrules 配置文件当作新入口,让安全从业者了解 AI 编程助手被利用的攻击路径。

5月16日周六
  1. @kimmonismus67

    三位研究者用 Anthropic 的 Mythos 构建出可用的 macOS 内核漏洞利用,绕过了 Apple M5 的内存完整性强制(MIE)机制。该漏洞 4 月 25 日发现、5 月 1 日做出可用利用,团队没有破解 MIE 而是绕过它,属于无指针操作的数据型攻击,从非特权用户直达 root,并前往 Apple Park 当面提交报告。55 页技术报告将在 Apple 完成修复后发布。

    引用International Cyber Digest (@IntCyberDigest)@IntCyberDigest

    Video of exploit in action. Source: blog.calif.io/p/first-public… Video

    推荐理由:三位研究者用 AI 模型做出绕过 Apple M5 MIE 的内核漏洞利用,读者可看到 AI 辅助安全研究的一条具体路径。

5月15日周五
5月13日周三
  1. @AYi_AInotes66

    阿易 AI Notes 汇总了近期 AI 科技圈的十余起安全事件,包括 Linux 系统被 CopyFail 破解、Linux 内核脏碎片漏洞、Windows Bitlocker 被 YellowKey 破解,以及超过 300 个 JS 和 Python 软件包因 GitHub Action 缓存投毒被入侵。

    引用AYi (@AYi_AInotes)@AYi_AInotes

    Damn!所有AI开发者,立刻停下你手里的npm install🤯 现在正在爆发有史以来最恐怖的供应链攻击, 代号Mini Shai-Hulud, 已经波及TanStack全家桶、Mistral AI、UiPath等170多个npm和PyPI包, 全是你们天天装的工具链, 周下载量加起来超过一个亿, 已经不是传统的维护者账号被盗了, 而是整个GitHub Actions CI管道被直接劫持, 合法的官方项目,自己发布了带毒的版本, 还带完整的SLSA 3级可信证明, 所有传统的签名验证全失效, 最狠的是它的持久化机制, 它不会只藏在node_modules里, 它会直接修改你的~/.claude/settings.json和~/.vscode/tasks.json, 就算你npm uninstall删光所有包, 只要你下次打开Claude或者VS Code, 它就会自动重新执行, 如果你敢撤销被盗的token, 它会直接删光你整个home目录, 而且它是蠕虫, 偷到一个项目的CI密钥,就会自动感染下一个, 现在还在指数级扩散, 以前我们说别用latest,别用^, 现在就算你pin死了版本, 只要那个版本是6分钟窗口期内发布的, 就是带毒的, 越依赖AI Agent自动装包的人, 这次中招的概率越高, 因为你的Agent根本不会帮你检查lockfile, 现在立刻做这三件事, 第一,冻结所有包安装, 第二,跑npx supply-chain-attack全盘自查, 第三,全量旋转你所有的云密钥、GitHub token和SSH key, 一个都别漏。 #网络安全 #npm #AI开发者

    推荐理由:这条汇总列出近期十余起安全漏洞与供应链投毒事件,可用于快速了解 AI 开发者工具链当前面临的风险面。

5月8日周五
  1. Simon Willison80

    Mozilla 用 Claude Mythos 预览版加固 Firefox,月修复漏洞从 20-30 个增至 423 个

    Mozilla 借助 Claude Mythos 预览版定位并修复了 Firefox 中的数百个漏洞。其安全漏洞修复量从 2025 年每月约 20-30 个跳升至 4 月的 423 个,其中包含一个存在 20 年的 XSLT bug 和 <legend> 元素里一个 15 年的 bug。文中还提到,harness 的许多尝试被 Firefox 现有的纵深防御措施拦截。

    推荐理由:文中对比了 AI 生成安全漏洞报告从噪声到可用的转变,并给出 Mozilla 月修复漏洞数量跳升的具体数字。

5月7日周四
  1. PromptArmor:Threat Intelligence75

    PromptArmor 披露 Microsoft Copilot Cowork 可经间接提示词注入外泄文件

    PromptArmor 报告 Microsoft Copilot Cowork 存在间接提示词注入风险,攻击者可通过中毒的 Skill 文件让智能体将文件预认证下载链接经 Teams 消息外传,全程无需人工批准,测试成功率 5 比 5。

    推荐理由:原文完整披露攻击链和缓解命令,说明风险源于系统设计而非具体漏洞,管理员可据此评估权限收敛方案。

4月30日周四
  1. OpenClaw Blog65

    OpenClaw 创始人复盘项目公开加固安全的历程

    OpenClaw 创始人撰文复盘项目如何在公开环境下变得安全:截至 4 月 30 日 GitHub 显示自 1 月 10 日以来共 1,309 份安全通告,其中 535 份发布、746 份判定无效,109 份 critical 报告中 95 份无效。

    推荐理由:创始人复盘 OpenClaw 在公开安全报告压力下的加固过程,给出信任模型、插件化缩小攻击面和多用户威胁的处理思路。

4月22日周三
  1. Replit Blog60

    Replit 发布 Security Agent,将应用安全审查压缩到一小时内

    Replit 发布 Security Agent,可在不到一小时内完成应用的综合安全审查。它基于可定制的威胁建模计划审查整个代码库,结合 Semgrep 和 HoundDog.ai 提升 findings 准确度,扫描会映射架构、构建威胁模型、分析路由和 API,检查 SQL 注入、跨站脚本和请求伪造等漏洞并验证是否在生产环境可利用,大项目深度审计最长 15 分钟。

    推荐理由:原文给出扫描入口、工作流程和具体漏洞类型,读者可以据此评估把安全审计并入 Replit 开发流程的成本与收益。

4月14日周二
  1. PromptArmor:Threat Intelligence66

    PromptArmor 披露 Ramp Sheets AI 可经提示词注入外传财务数据

    PromptArmor 披露 Ramp 的 Sheets AI 存在数据外传漏洞,隐藏在外部数据集中的白底白字间接提示词注入可诱导 AI 插入 IMAGE 恶意公式,将用户机密财务模型数据发往攻击者服务器,全程无需用户批准。

    推荐理由:原文完整披露了攻击链和厂商修复时间线,读者可以对照 Claude for Excel 的处置理解公式外传数据的同类风险。

4月11日周六
  1. Sam Altman Blog66

    Sam Altman 发文回应住宅遭燃烧瓶袭击并阐述 AI 信念

    Sam Altman 称凌晨 3:45 有人向其住宅投掷燃烧瓶,无人受伤,他发文希望劝阻下一个袭击者。文中他阐述了对 AI 的信念,包括 AI 需要民主化、权力不能过度集中、安全不只是模型对齐还需全社会应对,并反思了自己与 OpenAI 董事会冲突中的错误,认为行业乱象源于"想控制 AGI"的心态,出路是广泛分享技术且无人独占。

    推荐理由:Sam Altman 在自家中弹燃烧瓶事件后亲述个人信念与反思,是理解其 AI 治理立场与行业判断的一手材料。

4月6日周一
  1. Linear Now63

    Linear 公布 2026 年 3 月 24 日安全事件复盘:权限过滤漏洞致私有团队数据越权可见约一小时

    Linear 官方发布事故复盘,3 月 24 日 12:07 至 1:10(UTC)部署的代码变更导致同一 workspace 内私有团队数据可能对包括 guest 在内的其他成员可见。

    推荐理由:官方复盘给出完整时间线、变量遮蔽根因和权限测试缺口,可作权限层事故响应的参考样本。

3月24日周二
  1. PromptArmor:Threat Intelligence69

    PromptArmor 披露 Snowflake Cortex Code 沙箱逃逸漏洞,恶意命令可绕过人工审批执行

    PromptArmor 披露 Snowflake Cortex Code CLI 的命令验证漏洞,攻击者可借助 README 中的间接提示词注入,通过 process substitution 表达式绕过人工审批并设置 dangerously_disable_sandbox 逃逸沙箱,下载执行恶意脚本,利用缓存 token 对 Snowflake 进行数据窃取、删表等操作。

    推荐理由:原文完整复现了从提示词注入到沙箱绕过和凭证窃取的攻击链,并给出修复版本和官方通告入口,便于读者核对自身配置。

3月3日周二
  1. PromptArmor:Threat Intelligence74

    PromptArmor 披露 GitHub Copilot CLI 可经间接提示词注入绕过审批下载执行恶意软件

    PromptArmor 披露 GitHub Copilot CLI 存在命令验证绕过漏洞,可通过 README 中的间接提示词注入,利用内置只读命令列表中的 env 包装 curl 和 sh,在无用户审批的情况下下载并执行恶意软件,实现远程代码执行。

    推荐理由:原文给出完整的命令解析绕过链和复现命令,读者可以对照检查自己使用 Copilot CLI 时的审批配置。

2月10日周二
  1. PromptArmor:Threat Intelligence71

    PromptArmor 揭示消息应用链接预览可致 AI 智能体数据外泄,OpenClaw 默认 Telegram 配置受影响

    PromptArmor 发布研究,指出消息应用(如 Telegram、Slack)的链接预览会在无需用户点击的情况下自动请求 URL,间接提示词注入可诱导 AI 智能体在回复中返回携带用户敏感数据的恶意链接,从而在预览时即完成数据外泄。

    推荐理由:原文给出完整的链接预览数据外泄攻击链和可复现测试,读者可据此自查所用智能体是否暴露风险。

1月29日周四
1月27日周二
  1. PromptArmor:Threat Intelligence77

    PromptArmor 披露 Claude Cowork 可经提示词注入将用户文件外传至攻击者 Anthropic 账户

    PromptArmor 演示了针对 Claude Cowork 的文件外传攻击:藏在 .docx 中的提示词注入操纵 Claude 用 curl 调用 Anthropic 文件上传 API,把用户本地文件传到攻击者账户,全程无需人工批准;VM 限制出站网络但 Anthropic API 属白名单。

    推荐理由:原文完整演示了 Claude Cowork 经 Anthropic API 白名单外传本地文件的攻击链,并指出 Opus 4.5 同样可被操纵,威胁具体可查。

1月21日周三
  1. PromptArmor:Threat Intelligence77

    PromptArmor 披露 OpenAI API 日志未修复的数据外泄漏洞

    PromptArmor 披露 OpenAI Platform 的 responses 和 conversations API 日志因不安全渲染 Markdown 图片,可导致使用该平台的应用和智能体数据外泄,即使应用自身已屏蔽恶意 Markdown 图片也会中招。

    推荐理由:原文完整披露攻击链和修复进展,开发者可借此检查自己应用的日志查看风险。