跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

当前仅显示精选新闻
162条精选相关主题论文研究政策监管推理能力

最新精选

第 141–160 条 · 共 162 条
7月3日周五
7月2日周四
  1. Anthropic Newsroom61

    Anthropic 详解 Claude Fable 5 网络安全防护并发布越狱严重性框架草案

    Anthropic 宣布 Claude Fable 5 重新部署并面向全球所有用户开放,同时公布其网络安全安全分类器的细节和一份 AI 越狱严重性框架草案。分类器把网络安全用途分为禁止使用、高风险双用途、低风险双用途和良性使用四类,分别对应拦截、监控或放行,并设有比以往模型更大的安全边界。

    推荐理由:Anthropic 披露 Fable 5 安全分类器的四类用途边界,并提出按能力增益与可利用性打分的越狱危害评级草案。

6月12日周五
  1. Anthropic Newsroom86

    Anthropic 因美国政府出口管制指令暂停 Fable 5 与 Mythos 5 访问

    美国以国家安全为由发布出口管制指令,禁止包括 Anthropic 外国籍员工在内的任何外国国民访问 Fable 5 和 Mythos 5,Anthropic 因此须对全部客户停用这两款模型,其他 Anthropic 模型不受影响。

    推荐理由:原文给出政府指令的具体要求与 Anthropic 的回应依据,读者可了解前沿模型商用部署与监管尺度之间的争议点。

6月10日周三
  1. @kimmonismus68

    Anthropic 的 Fable 5 保障机制在前沿 LLM 开发场景下不会直接拒绝或提醒用户,而是通过 prompt modification、steering vectors 和 PEFT 等方式悄悄降低模型自身的有效性。

    引用NomoreID (@Hangsiin)@Hangsiin

    When Fable 5 is used for frontier LLM development, it does not notify the user and instead limits the model’s capabilities through methods such as prompt modification, steering vectors, and PEFT. Anthropic estimated that this would affect approximately 0.03% of traffic.

    推荐理由:材料呈现模型在敏感领域被悄然降能的机制,可供观察厂商在能力与安全之间的取舍方式。

6月9日周二
6月2日周二
6月1日周一
  1. OpenAI News64

    OpenAI 封禁疑与中国相关、用 AI 生成批评美国数据中心内容的账号集群

    OpenAI 封禁了一个疑似源自中国的账号集群,该集群使用 AI 生成社交媒体内容,批评美国的数据中心和 AI 基础设施。相关内容被归入名为 Data Center Bandwagon 的面向美国的影响力行动。

    推荐理由:OpenAI 披露了一次针对其平台的 AI 影响力行动处置结果,读者可了解生成式内容被用于舆论操作的具体形态。

5月29日周五
5月27日周三
  1. Claude Blog76

    Anthropic 分享用 LLM 保障源码安全的六步流程

    Anthropic 发布指南,介绍如何用 Claude Opus 通过威胁建模、沙箱、发现、验证、分诊、修补六个步骤查找并修复源码漏洞。文中称截至 2026 年 5 月 22 日其开源软件扫描已披露 1596 个漏洞,其中 97 个已修补,瓶颈已从发现转向验证、分诊与修补。

    推荐理由:文章把漏洞发现到修补拆成六步方法并附可复用 skill 与仓库,瓶颈已转向验证与修补。

5月25日周一
  1. @kimmonismus65

    代号 TrapDoor 的供应链攻击同时针对 npm、PyPI 和 Crates.io,投递 34 个恶意包,目标是加密货币、AI 和安全开发者,用于窃取钱包、SSH 密钥和云凭证。

    引用Socket (@SocketSecurity)@SocketSecurity

    More analysis, package details, IOCs, and GitHub-related activity here, including attacker-hosted payload/config infrastructure and PRs attempting to add .cursorrules / CLAUDE.md files to popular AI and developer projects: socket.dev/blog/trapdoor-cry…

    推荐理由:该攻击把 CLAUDE.md 与 .cursorrules 配置文件当作新入口,让安全从业者了解 AI 编程助手被利用的攻击路径。

5月16日周六
  1. @kimmonismus67

    三位研究者用 Anthropic 的 Mythos 构建出可用的 macOS 内核漏洞利用,绕过了 Apple M5 的内存完整性强制(MIE)机制。该漏洞 4 月 25 日发现、5 月 1 日做出可用利用,团队没有破解 MIE 而是绕过它,属于无指针操作的数据型攻击,从非特权用户直达 root,并前往 Apple Park 当面提交报告。55 页技术报告将在 Apple 完成修复后发布。

    引用International Cyber Digest (@IntCyberDigest)@IntCyberDigest

    Video of exploit in action. Source: blog.calif.io/p/first-public… Video

    推荐理由:三位研究者用 AI 模型做出绕过 Apple M5 MIE 的内核漏洞利用,读者可看到 AI 辅助安全研究的一条具体路径。

5月13日周三
  1. @AYi_AInotes66

    阿易 AI Notes 汇总了近期 AI 科技圈的十余起安全事件,包括 Linux 系统被 CopyFail 破解、Linux 内核脏碎片漏洞、Windows Bitlocker 被 YellowKey 破解,以及超过 300 个 JS 和 Python 软件包因 GitHub Action 缓存投毒被入侵。

    引用AYi (@AYi_AInotes)@AYi_AInotes

    Damn!所有AI开发者,立刻停下你手里的npm install🤯 现在正在爆发有史以来最恐怖的供应链攻击, 代号Mini Shai-Hulud, 已经波及TanStack全家桶、Mistral AI、UiPath等170多个npm和PyPI包, 全是你们天天装的工具链, 周下载量加起来超过一个亿, 已经不是传统的维护者账号被盗了, 而是整个GitHub Actions CI管道被直接劫持, 合法的官方项目,自己发布了带毒的版本, 还带完整的SLSA 3级可信证明, 所有传统的签名验证全失效, 最狠的是它的持久化机制, 它不会只藏在node_modules里, 它会直接修改你的~/.claude/settings.json和~/.vscode/tasks.json, 就算你npm uninstall删光所有包, 只要你下次打开Claude或者VS Code, 它就会自动重新执行, 如果你敢撤销被盗的token, 它会直接删光你整个home目录, 而且它是蠕虫, 偷到一个项目的CI密钥,就会自动感染下一个, 现在还在指数级扩散, 以前我们说别用latest,别用^, 现在就算你pin死了版本, 只要那个版本是6分钟窗口期内发布的, 就是带毒的, 越依赖AI Agent自动装包的人, 这次中招的概率越高, 因为你的Agent根本不会帮你检查lockfile, 现在立刻做这三件事, 第一,冻结所有包安装, 第二,跑npx supply-chain-attack全盘自查, 第三,全量旋转你所有的云密钥、GitHub token和SSH key, 一个都别漏。 #网络安全 #npm #AI开发者

    推荐理由:这条汇总列出近期十余起安全漏洞与供应链投毒事件,可用于快速了解 AI 开发者工具链当前面临的风险面。

5月8日周五
  1. Simon Willison80

    Mozilla 用 Claude Mythos 预览版加固 Firefox,月修复漏洞从 20-30 个增至 423 个

    Mozilla 借助 Claude Mythos 预览版定位并修复了 Firefox 中的数百个漏洞。其安全漏洞修复量从 2025 年每月约 20-30 个跳升至 4 月的 423 个,其中包含一个存在 20 年的 XSLT bug 和 <legend> 元素里一个 15 年的 bug。文中还提到,harness 的许多尝试被 Firefox 现有的纵深防御措施拦截。

    推荐理由:文中对比了 AI 生成安全漏洞报告从噪声到可用的转变,并给出 Mozilla 月修复漏洞数量跳升的具体数字。

5月7日周四
4月11日周六
  1. Sam Altman Blog66

    Sam Altman 发文回应住宅遭燃烧瓶袭击并阐述 AI 信念

    Sam Altman 称凌晨 3:45 有人向其住宅投掷燃烧瓶,无人受伤,他发文希望劝阻下一个袭击者。文中他阐述了对 AI 的信念,包括 AI 需要民主化、权力不能过度集中、安全不只是模型对齐还需全社会应对,并反思了自己与 OpenAI 董事会冲突中的错误,认为行业乱象源于"想控制 AGI"的心态,出路是广泛分享技术且无人独占。

    推荐理由:Sam Altman 在自家中弹燃烧瓶事件后亲述个人信念与反思,是理解其 AI 治理立场与行业判断的一手材料。

4月6日周一
  1. Linear Now63

    Linear 公布 2026 年 3 月 24 日安全事件复盘:权限过滤漏洞致私有团队数据越权可见约一小时

    Linear 官方发布事故复盘,3 月 24 日 12:07 至 1:10(UTC)部署的代码变更导致同一 workspace 内私有团队数据可能对包括 guest 在内的其他成员可见。

    推荐理由:官方复盘给出完整时间线、变量遮蔽根因和权限测试缺口,可作权限层事故响应的参考样本。

11月6日周四
  1. Microsoft AI News64

    Microsoft AI 提出 Humanist Superintelligence 理念并组建 MAI Superintelligence Team

    Microsoft AI 发布长文,提出 Humanist Superintelligence(HSI)理念,即面向具体领域、受控服务于人类的超智能,并宣布组建由作者领导的 MAI Superintelligence Team。

    推荐理由:Microsoft AI 提出以人类为中心、领域受限的超智能路线,文中给出医疗诊断等具体方向和 containment 难题的判断。

4月15日周二
  1. AI as Normal Technology65

    Arvind Narayanan 发布长文论文《AI as Normal Technology》,将 AI 视为常态技术

    Arvind Narayanan 发布超过 1.5 万字的新论文,提出将 AI 视为“常态技术”的世界观,认为其影响类似电力和互联网等通用技术,变革性经济与社会影响将以数十年为时间尺度缓慢展开。

    推荐理由:作者提出 AI 是像电力一样的常态技术,经济影响将以数十年计缓慢扩散,并给出风险与政策的替代框架。

12月14日周六
  1. AI as Normal Technology72

    分析 78 个选举深度伪造案例后,Sayash Kapoor 认为政治误信息不是 AI 问题

    Sayash Kapoor 分析 WIRED AI Elections Project 收录的 78 个 2024 年选举 AI 使用案例,发现其中 39 个无欺骗意图,而 39 个欺骗性内容不用 AI 也能以几百美元内的成本复制。文章提出误信息的关键在需求侧而非供给侧,治理信息环境依赖结构性、制度性改变,而非限制 AI 生成内容。

    推荐理由:作者基于 WIRED 数据库 78 个案例给出一手分析,指出政治误信息更多是需求侧的结构性问题,值得从供需视角重新审视。