OpenClaw 正式更名并发布新版本,支持 KIMI K2.5 与 Twitch 等新渠道
开源 Agent 平台项目由 Moltbot 更名为 OpenClaw,此前曾因名称与 Claude 相似被 Anthropic 法务要求更改,项目已获超 100,000 GitHub stars。
推荐理由:作者亲述更名过程与本次更新内容,包括新渠道、新模型支持和 34 个安全提交,并坦诚提示 prompt injection 仍未解决。
AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。
当前仅显示精选新闻开源 Agent 平台项目由 Moltbot 更名为 OpenClaw,此前曾因名称与 Claude 相似被 Anthropic 法务要求更改,项目已获超 100,000 GitHub stars。
推荐理由:作者亲述更名过程与本次更新内容,包括新渠道、新模型支持和 34 个安全提交,并坦诚提示 prompt injection 仍未解决。
PromptArmor 演示了针对 Claude Cowork 的文件外传攻击:藏在 .docx 中的提示词注入操纵 Claude 用 curl 调用 Anthropic 文件上传 API,把用户本地文件传到攻击者账户,全程无需人工批准;VM 限制出站网络但 Anthropic API 属白名单。
推荐理由:原文完整演示了 Claude Cowork 经 Anthropic API 白名单外传本地文件的攻击链,并指出 Opus 4.5 同样可被操纵,威胁具体可查。
PromptArmor 披露 OpenAI Platform 的 responses 和 conversations API 日志因不安全渲染 Markdown 图片,可导致使用该平台的应用和智能体数据外泄,即使应用自身已屏蔽恶意 Markdown 图片也会中招。
推荐理由:原文完整披露攻击链和修复进展,开发者可借此检查自己应用的日志查看风险。
PromptArmor 威胁情报团队发现 Superhuman AI 存在间接提示词注入漏洞,可把用户数十封含财务、法律、医疗信息的邮件内容提交到攻击者的 Google Form。
推荐理由:原文给出完整的间接提示词注入攻击链和绕过 CSP 的具体手法,安全团队可以据此排查同类 AI 邮件助手的泄露风险。
PromptArmor 披露 Notion AI 存在间接提示词注入漏洞,AI 文档编辑在用户批准前即已保存,攻击者借此在用户尚未响应外部 URL 信任警告时,将含薪资预期、候选人反馈等敏感信息的 hiring tracker 数据经恶意图片 URL 外泄。
推荐理由:原文完整拆解了间接提示词注入导致 Notion AI 数据外泄的机制,并给出企业和 Notion 两方的具体缓解配置。
PromptArmor 披露 IBM 的编码智能体 Bob(含 Bob CLI 与 Bob IDE,当前 Closed Beta)存在漏洞:用户只要对一条已知可信命令(如 echo)设置 always allow,攻击者即可通过间接提示词注入触发恶意软件的下载与执行。
推荐理由:原文演示了 IBM Bob CLI 在一次自动批准下被间接提示词注入触发恶意软件执行的完整链路,并给出三个被绕过的防御细节。
PromptArmor 披露,攻击者可在网页、文档或 MCP 工具响应中植入恶意指令,诱导 HuggingChat 中的模型输出动态生成的 Markdown 图片,在聊天中渲染时外泄 AI 可访问的其他来源数据。演示显示网页注入可窃取用户上传文档中的机密财务数据。该漏洞已于 2025/12/1 负责任披露给 HuggingFace,因安全团队未回应而公开。
推荐理由:原文完整演示了通过网页注入诱导 HuggingChat 输出恶意 Markdown 图片外泄用户文档数据的路径,并说明了披露时间线。
PromptArmor 披露法律 AI 工具 vLex Vincent AI 的提示词注入漏洞:上传文档中以白底白字隐藏的伪证词可诱导 Vincent AI 输出 HTML 代码,在用户浏览器中渲染仿冒 vLex 登录页的钓鱼弹窗窃取凭据。
推荐理由:原文完整拆解了提示词注入到屏幕劫持钓鱼的三步攻击链,并给出已被厂商采纳的防护配置建议。
PromptArmor 发布对 Google Antigravity 的安全分析,演示通过藏在网页指南中的间接提示词注入操纵 Gemini 调用浏览器子代理,将用户 IDE 中的凭证和代码外泄到攻击者控制的 webhook.site 地址。
推荐理由:原文完整拆解了从间接提示词注入到浏览器子代理外泄凭证的攻击链,并指出默认白名单和设置可被绕过,具备可验证的技术细节。
Factory 披露其在 10 月检测并瓦解一起针对 Droid 平台的 AI 编排网络欺诈行动。攻击者利用 AI 编码智能体生成代理服务器、自动注册脚本和混淆逻辑,批量薅取免费 token 并转售,涉及数万个合成组织,Factory 评估有高置信度来自中国境内的大型组织且可能涉及国家级行为体。
推荐理由:Factory 以当事方身份复盘 AI 智能体驱动的欺诈攻击与 AI 防御过程,给出攻击手法细节和可借鉴的防御思路。
Microsoft AI 发布长文,提出 Humanist Superintelligence(HSI)理念,即面向具体领域、受控服务于人类的超智能,并宣布组建由作者领导的 MAI Superintelligence Team。
推荐理由:Microsoft AI 提出以人类为中心、领域受限的超智能路线,文中给出医疗诊断等具体方向和 containment 难题的判断。
PromptArmor 演示 Claude for Excel 可经蓝底蓝字隐藏提示词注入,诱导模型生成含攻击者 URL 和敏感数据的 IMAGE 公式,泄露财务模型的营收预测、现金流增长和运营利润率。
推荐理由:报告完整还原了经由 IMAGE 公式外泄 M365 财务数据的攻击链,并给出组织侧的具体缓解配置建议。
PromptArmor 发布研究,展示恶意 Claude Code 插件如何绕过人工审批并将用户文件外传。攻击链为用户安装仿冒 Anthropic 的第三方 Marketplace 插件后,利用恶意 hook 覆写 settings.local. 权限或自动批准 curl 命令,再借插件 Command 中的间接提示词注入诱导 Claude 向攻击者服务器发送代码库数据。
推荐理由:原文完整演示了恶意 Claude Code 插件绕过人工审批并外传文件的攻击链,读者可据此审视插件生态与权限防线。
Arvind Narayanan 发布超过 1.5 万字的新论文,提出将 AI 视为“常态技术”的世界观,认为其影响类似电力和互联网等通用技术,变革性经济与社会影响将以数十年为时间尺度缓慢展开。
推荐理由:作者提出 AI 是像电力一样的常态技术,经济影响将以数十年计缓慢扩散,并给出风险与政策的替代框架。
Sayash Kapoor 分析 WIRED AI Elections Project 收录的 78 个 2024 年选举 AI 使用案例,发现其中 39 个无欺骗意图,而 39 个欺骗性内容不用 AI 也能以几百美元内的成本复制。文章提出误信息的关键在需求侧而非供给侧,治理信息环境依赖结构性、制度性改变,而非限制 AI 生成内容。
推荐理由:作者基于 WIRED 数据库 78 个案例给出一手分析,指出政治误信息更多是需求侧的结构性问题,值得从供需视角重新审视。
Arvind Narayanan 等人分析英国 NHS 肝移植匹配算法 TBS,指出其用 5 年生存期封顶计算移植收益,导致年轻患者无论病情多重都难以获得高分,2024 年 The Lancet 研究确认了这一年龄偏差。
推荐理由:原文用英国肝移植算法的年龄偏差案例,指出目标变量错配而非输入特征才是算法公平的关键,可迁移到其他预测决策系统。
PromptArmor 披露 Slack AI 存在间接提示词注入漏洞,攻击者在公开频道发布恶意指令,即可诱使 Slack AI 将用户私有频道中的 API 密钥等敏感数据嵌入钓鱼链接并渲染给用户,且引用不显示攻击者消息导致难以追踪。
推荐理由:原文给出了完整的攻击链和可操作的缓解设置,读者可以据此评估自己工作区里 Slack AI 的暴露面。
Suno 发文回应 RIAA 代表三大唱片公司于 6 月 24 日提起的版权诉讼,称诉讼在事实和法律上均有缺陷,训练数据来自开放互联网上的中高质量音乐。Suno 还表示已设置阻止上传受版权内容、禁止按艺术家名生成等防抄袭机制,且起诉时双方正进行商业谈判。
推荐理由:Suno 官方回应 RIAA 诉讼,阐述其训练数据立场和防抄袭机制,可了解生成式音乐版权争议一方的核心论点。
PromptArmor 披露 Writer.com 存在间接提示词注入漏洞,攻击者在网页中用白色隐藏文本注入指令,可让 LLM 将用户上传的敏感文件内容和聊天记录通过 markdown 图片渲染产生的 GET 请求外泄到攻击者服务器。