最新精选
第 661–668 条 · 共 668 条Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。
推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。
开源 Agent 平台项目由 Moltbot 更名为 OpenClaw,此前曾因名称与 Claude 相似被 Anthropic 法务要求更改,项目已获超 100,000 GitHub stars。
推荐理由:作者亲述更名过程与本次更新内容,包括新渠道、新模型支持和 34 个安全提交,并坦诚提示 prompt injection 仍未解决。
PromptArmor 演示了针对 Claude Cowork 的文件外传攻击:藏在 .docx 中的提示词注入操纵 Claude 用 curl 调用 Anthropic 文件上传 API,把用户本地文件传到攻击者账户,全程无需人工批准;VM 限制出站网络但 Anthropic API 属白名单。
推荐理由:原文完整演示了 Claude Cowork 经 Anthropic API 白名单外传本地文件的攻击链,并指出 Opus 4.5 同样可被操纵,威胁具体可查。
Factory 披露其在 10 月检测并瓦解一起针对 Droid 平台的 AI 编排网络欺诈行动。攻击者利用 AI 编码智能体生成代理服务器、自动注册脚本和混淆逻辑,批量薅取免费 token 并转售,涉及数万个合成组织,Factory 评估有高置信度来自中国境内的大型组织且可能涉及国家级行为体。
推荐理由:Factory 以当事方身份复盘 AI 智能体驱动的欺诈攻击与 AI 防御过程,给出攻击手法细节和可借鉴的防御思路。
PromptArmor 演示 Claude for Excel 可经蓝底蓝字隐藏提示词注入,诱导模型生成含攻击者 URL 和敏感数据的 IMAGE 公式,泄露财务模型的营收预测、现金流增长和运营利润率。
推荐理由:报告完整还原了经由 IMAGE 公式外泄 M365 财务数据的攻击链,并给出组织侧的具体缓解配置建议。
PromptArmor 发布研究,展示恶意 Claude Code 插件如何绕过人工审批并将用户文件外传。攻击链为用户安装仿冒 Anthropic 的第三方 Marketplace 插件后,利用恶意 hook 覆写 settings.local. 权限或自动批准 curl 命令,再借插件 Command 中的间接提示词注入诱导 Claude 向攻击者服务器发送代码库数据。
推荐理由:原文完整演示了恶意 Claude Code 插件绕过人工审批并外传文件的攻击链,读者可据此审视插件生态与权限防线。
Factory 宣布其软件开发智能体 Droid 以 58.8% 的任务解决率在 Terminal-Bench 排行榜第一,Opus 4.1、GPT-5 和 Sonnet 4 三种单模型配置均显著领先其他单模型智能体,并超过 Codex CLI(42.8%)和 Claude Code(43.2%)。
推荐理由:原文在成绩之外给出智能体设计的可复用做法,如分层提示词、模型专属适配和精简工具,能帮助改进自己的 Agent。
Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 撰文分析 OpenAI、Anthropic 和 Google Gemini 下一代模型遇阻后的叙事翻转,认为宣布模型扩展已死为时尚早,行业领袖的预测并不可靠。
推荐理由:作者用可核查的证据指出业内叙事反复翻转的成因,并区分能力提升与实际社会影响的薄弱关联。