跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

当前仅显示精选新闻
199条精选相关主题论文研究政策监管推理能力

最新精选

第 181–199 条 · 共 199 条
5月27日周三
  1. Claude Blog76

    Anthropic 分享用 LLM 保障源码安全的六步流程

    Anthropic 发布指南,介绍如何用 Claude Opus 通过威胁建模、沙箱、发现、验证、分诊、修补六个步骤查找并修复源码漏洞。文中称截至 2026 年 5 月 22 日其开源软件扫描已披露 1596 个漏洞,其中 97 个已修补,瓶颈已从发现转向验证、分诊与修补。

    推荐理由:文章把漏洞发现到修补拆成六步方法并附可复用 skill 与仓库,瓶颈已转向验证与修补。

5月25日周一
  1. @kimmonismus65

    代号 TrapDoor 的供应链攻击同时针对 npm、PyPI 和 Crates.io,投递 34 个恶意包,目标是加密货币、AI 和安全开发者,用于窃取钱包、SSH 密钥和云凭证。

    引用Socket (@SocketSecurity)@SocketSecurity

    More analysis, package details, IOCs, and GitHub-related activity here, including attacker-hosted payload/config infrastructure and PRs attempting to add .cursorrules / CLAUDE.md files to popular AI and developer projects: socket.dev/blog/trapdoor-cry…

    推荐理由:该攻击把 CLAUDE.md 与 .cursorrules 配置文件当作新入口,让安全从业者了解 AI 编程助手被利用的攻击路径。

5月16日周六
  1. @kimmonismus67

    三位研究者用 Anthropic 的 Mythos 构建出可用的 macOS 内核漏洞利用,绕过了 Apple M5 的内存完整性强制(MIE)机制。该漏洞 4 月 25 日发现、5 月 1 日做出可用利用,团队没有破解 MIE 而是绕过它,属于无指针操作的数据型攻击,从非特权用户直达 root,并前往 Apple Park 当面提交报告。55 页技术报告将在 Apple 完成修复后发布。

    引用International Cyber Digest (@IntCyberDigest)@IntCyberDigest

    Video of exploit in action. Source: blog.calif.io/p/first-public… Video

    推荐理由:三位研究者用 AI 模型做出绕过 Apple M5 MIE 的内核漏洞利用,读者可看到 AI 辅助安全研究的一条具体路径。

5月15日周五
5月13日周三
  1. @AYi_AInotes66

    阿易 AI Notes 汇总了近期 AI 科技圈的十余起安全事件,包括 Linux 系统被 CopyFail 破解、Linux 内核脏碎片漏洞、Windows Bitlocker 被 YellowKey 破解,以及超过 300 个 JS 和 Python 软件包因 GitHub Action 缓存投毒被入侵。

    引用AYi (@AYi_AInotes)@AYi_AInotes

    Damn!所有AI开发者,立刻停下你手里的npm install🤯 现在正在爆发有史以来最恐怖的供应链攻击, 代号Mini Shai-Hulud, 已经波及TanStack全家桶、Mistral AI、UiPath等170多个npm和PyPI包, 全是你们天天装的工具链, 周下载量加起来超过一个亿, 已经不是传统的维护者账号被盗了, 而是整个GitHub Actions CI管道被直接劫持, 合法的官方项目,自己发布了带毒的版本, 还带完整的SLSA 3级可信证明, 所有传统的签名验证全失效, 最狠的是它的持久化机制, 它不会只藏在node_modules里, 它会直接修改你的~/.claude/settings.json和~/.vscode/tasks.json, 就算你npm uninstall删光所有包, 只要你下次打开Claude或者VS Code, 它就会自动重新执行, 如果你敢撤销被盗的token, 它会直接删光你整个home目录, 而且它是蠕虫, 偷到一个项目的CI密钥,就会自动感染下一个, 现在还在指数级扩散, 以前我们说别用latest,别用^, 现在就算你pin死了版本, 只要那个版本是6分钟窗口期内发布的, 就是带毒的, 越依赖AI Agent自动装包的人, 这次中招的概率越高, 因为你的Agent根本不会帮你检查lockfile, 现在立刻做这三件事, 第一,冻结所有包安装, 第二,跑npx supply-chain-attack全盘自查, 第三,全量旋转你所有的云密钥、GitHub token和SSH key, 一个都别漏。 #网络安全 #npm #AI开发者

    推荐理由:这条汇总列出近期十余起安全漏洞与供应链投毒事件,可用于快速了解 AI 开发者工具链当前面临的风险面。

5月8日周五
  1. Simon Willison80

    Mozilla 用 Claude Mythos 预览版加固 Firefox,月修复漏洞从 20-30 个增至 423 个

    Mozilla 借助 Claude Mythos 预览版定位并修复了 Firefox 中的数百个漏洞。其安全漏洞修复量从 2025 年每月约 20-30 个跳升至 4 月的 423 个,其中包含一个存在 20 年的 XSLT bug 和 <legend> 元素里一个 15 年的 bug。文中还提到,harness 的许多尝试被 Firefox 现有的纵深防御措施拦截。

    推荐理由:文中对比了 AI 生成安全漏洞报告从噪声到可用的转变,并给出 Mozilla 月修复漏洞数量跳升的具体数字。

5月7日周四
4月30日周四
  1. OpenClaw Blog65

    OpenClaw 创始人复盘项目公开加固安全的历程

    OpenClaw 创始人撰文复盘项目如何在公开环境下变得安全:截至 4 月 30 日 GitHub 显示自 1 月 10 日以来共 1,309 份安全通告,其中 535 份发布、746 份判定无效,109 份 critical 报告中 95 份无效。

    推荐理由:创始人复盘 OpenClaw 在公开安全报告压力下的加固过程,给出信任模型、插件化缩小攻击面和多用户威胁的处理思路。

4月22日周三
  1. Replit Blog60

    Replit 发布 Security Agent,将应用安全审查压缩到一小时内

    Replit 发布 Security Agent,可在不到一小时内完成应用的综合安全审查。它基于可定制的威胁建模计划审查整个代码库,结合 Semgrep 和 HoundDog.ai 提升 findings 准确度,扫描会映射架构、构建威胁模型、分析路由和 API,检查 SQL 注入、跨站脚本和请求伪造等漏洞并验证是否在生产环境可利用,大项目深度审计最长 15 分钟。

    推荐理由:原文给出扫描入口、工作流程和具体漏洞类型,读者可以据此评估把安全审计并入 Replit 开发流程的成本与收益。

4月11日周六
  1. Sam Altman Blog66

    Sam Altman 发文回应住宅遭燃烧瓶袭击并阐述 AI 信念

    Sam Altman 称凌晨 3:45 有人向其住宅投掷燃烧瓶,无人受伤,他发文希望劝阻下一个袭击者。文中他阐述了对 AI 的信念,包括 AI 需要民主化、权力不能过度集中、安全不只是模型对齐还需全社会应对,并反思了自己与 OpenAI 董事会冲突中的错误,认为行业乱象源于"想控制 AGI"的心态,出路是广泛分享技术且无人独占。

    推荐理由:Sam Altman 在自家中弹燃烧瓶事件后亲述个人信念与反思,是理解其 AI 治理立场与行业判断的一手材料。

4月6日周一
  1. Linear Now63

    Linear 公布 2026 年 3 月 24 日安全事件复盘:权限过滤漏洞致私有团队数据越权可见约一小时

    Linear 官方发布事故复盘,3 月 24 日 12:07 至 1:10(UTC)部署的代码变更导致同一 workspace 内私有团队数据可能对包括 guest 在内的其他成员可见。

    推荐理由:官方复盘给出完整时间线、变量遮蔽根因和权限测试缺口,可作权限层事故响应的参考样本。

1月29日周四
11月20日周四
  1. Factory 研究 / 产品76

    Factory 披露 Droid 平台遭 AI 编排欺诈攻击并用 AI 防御的完整复盘

    Factory 披露其在 10 月检测并瓦解一起针对 Droid 平台的 AI 编排网络欺诈行动。攻击者利用 AI 编码智能体生成代理服务器、自动注册脚本和混淆逻辑,批量薅取免费 token 并转售,涉及数万个合成组织,Factory 评估有高置信度来自中国境内的大型组织且可能涉及国家级行为体。

    推荐理由:Factory 以当事方身份复盘 AI 智能体驱动的欺诈攻击与 AI 防御过程,给出攻击手法细节和可借鉴的防御思路。

11月6日周四
  1. Microsoft AI News64

    Microsoft AI 提出 Humanist Superintelligence 理念并组建 MAI Superintelligence Team

    Microsoft AI 发布长文,提出 Humanist Superintelligence(HSI)理念,即面向具体领域、受控服务于人类的超智能,并宣布组建由作者领导的 MAI Superintelligence Team。

    推荐理由:Microsoft AI 提出以人类为中心、领域受限的超智能路线,文中给出医疗诊断等具体方向和 containment 难题的判断。

4月15日周二
  1. AI as Normal Technology65

    Arvind Narayanan 发布长文论文《AI as Normal Technology》,将 AI 视为常态技术

    Arvind Narayanan 发布超过 1.5 万字的新论文,提出将 AI 视为“常态技术”的世界观,认为其影响类似电力和互联网等通用技术,变革性经济与社会影响将以数十年为时间尺度缓慢展开。

    推荐理由:作者提出 AI 是像电力一样的常态技术,经济影响将以数十年计缓慢扩散,并给出风险与政策的替代框架。

12月14日周六
  1. AI as Normal Technology72

    分析 78 个选举深度伪造案例后,Sayash Kapoor 认为政治误信息不是 AI 问题

    Sayash Kapoor 分析 WIRED AI Elections Project 收录的 78 个 2024 年选举 AI 使用案例,发现其中 39 个无欺骗意图,而 39 个欺骗性内容不用 AI 也能以几百美元内的成本复制。文章提出误信息的关键在需求侧而非供给侧,治理信息环境依赖结构性、制度性改变,而非限制 AI 生成内容。

    推荐理由:作者基于 WIRED 数据库 78 个案例给出一手分析,指出政治误信息更多是需求侧的结构性问题,值得从供需视角重新审视。

11月12日周二
  1. AI as Normal Technology72

    英国肝移植匹配算法为何系统性不利于年轻患者

    Arvind Narayanan 等人分析英国 NHS 肝移植匹配算法 TBS,指出其用 5 年生存期封顶计算移植收益,导致年轻患者无论病情多重都难以获得高分,2024 年 The Lancet 研究确认了这一年龄偏差。

    推荐理由:原文用英国肝移植算法的年龄偏差案例,指出目标变量错配而非输入特征才是算法公平的关键,可迁移到其他预测决策系统。

8月1日周四
  1. Suno Blog70

    Suno 回应唱片业诉讼,称模型训练属学习而非侵权

    Suno 发文回应 RIAA 代表三大唱片公司于 6 月 24 日提起的版权诉讼,称诉讼在事实和法律上均有缺陷,训练数据来自开放互联网上的中高质量音乐。Suno 还表示已设置阻止上传受版权内容、禁止按艺术家名生成等防抄袭机制,且起诉时双方正进行商业谈判。

    推荐理由:Suno 官方回应 RIAA 诉讼,阐述其训练数据立场和防抄袭机制,可了解生成式音乐版权争议一方的核心论点。