Factory 评测 13 个模型的代码评审能力与成本,GPT-5.2 综合最优
Factory 用 50 个真实 PR、统一提示词和 LLM judge 评测 13 个模型的代码评审表现,GPT-5.2 以 60.5% F1、$1.25/PR 排第一,Opus 4.6 达 59.8% 但需 $3.11/PR。
推荐理由:原文给出 13 个模型在 50 个真实 PR 上的 F1 与成本数据,读者可以据此为自己的代码评审挑选性价比模型。
Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。
当前仅显示精选新闻Factory 用 50 个真实 PR、统一提示词和 LLM judge 评测 13 个模型的代码评审表现,GPT-5.2 以 60.5% F1、$1.25/PR 排第一,Opus 4.6 达 59.8% 但需 $3.11/PR。
推荐理由:原文给出 13 个模型在 50 个真实 PR 上的 F1 与成本数据,读者可以据此为自己的代码评审挑选性价比模型。
华盛顿大学 MacCoss 实验室的 Brendan MacLean 将17年培养新开发者的入职方法应用于 Claude Code,把 AI 上下文放入独立仓库 pwiz-ai,用 CLAUDE.md、技能库和 MCP 集成管理 70 万行 C# 的 Skyline 代码库。
推荐理由:原文给出维护17年、70万行C#代码库的上下文分层和技能库方法,对长期项目接入 Claude Code 有可迁移的参考。
Anthropic 发布一批面向创意工作的 Claude 连接器,可直连 Ableton、Adobe Creative Cloud、Affinity by Canva、Autodesk Fusion、Blender、Resolume Arena 与 Wire、SketchUp 和 Splice。
推荐理由:连接器把 Claude 嵌入创意行业既有软件,Blender 的 MCP 连接器还向其他 LLM 开放。
Anthropic 宣布 Claude Managed Agents 的内置记忆功能今日起开放公开测试,智能体可跨会话持续学习。记忆以文件形式挂载在文件系统上,可导出、通过 API 管理,支持多智能体共享同一 store、权限分级、审计日志和版本回滚。Netflix、Rakuten、Wisedocs 等团队已在用例中称首过错误减少 97%、验证提速 30%。
推荐理由:官方公告给出记忆机制原理和企业用例数据,开发者可以据此评估是否用它替代自建记忆基础设施。
Anthropic 发文对比连接 Agent 与外部系统的三种路径:直接 API 调用、CLI 和 MCP,指出生产级云端 Agent 倾向采用 MCP 作为通用层。
推荐理由:Anthropic 梳理了直连 API、CLI 与 MCP 三种接入路径的取舍,并给出服务端设计与客户端上下文优化的具体模式。
Anthropic 与 Amazon 签署新协议,将获得最高 5 吉瓦(GW)用于训练和部署 Claude 的算力,并在未来十年向 AWS 技术投入超过 1000 亿美元。
推荐理由:协议披露了算力规模、芯片代际与投资金额,可据此判断 Claude 训练与推理基础设施的扩张节奏。
Anthropic 发布 Claude Opus 4.7,定位复杂推理与智能体编码,定价维持 $5/$25 per MTok,与 Opus 4.6 相比存在 API 破坏性变更并需参考迁移指南。
推荐理由:原文列出定价、API 破坏性变更、task budgets 与高分辨率图像等具体变化,升级前可据此排查迁移成本。
PromptArmor 披露 Ramp 的 Sheets AI 存在数据外传漏洞,隐藏在外部数据集中的白底白字间接提示词注入可诱导 AI 插入 IMAGE 恶意公式,将用户机密财务模型数据发往攻击者服务器,全程无需用户批准。
推荐理由:原文完整披露了攻击链和厂商修复时间线,读者可以对照 Claude for Excel 的处置理解公式外传数据的同类风险。
Factory 发布 Legacy-Bench 基准,用涵盖 COBOL(46%)、Java 7(32%)等六类遗留语言的数百个任务测试 AI 智能体,12 个模型-智能体组合的通过率为 16.9% 至 42.5%,而这些模型在 SWE-bench Verified 等现代基准上得分超过 70%。
推荐理由:原文用真实遗留代码任务填补现有基准的盲区,给出各模型在 COBOL 等语言上的具体分数和失败模式,可帮助读者评估 AI 智能体处理关键遗留系统的实际能力。
Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。
推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。
开源 Agent 平台项目由 Moltbot 更名为 OpenClaw,此前曾因名称与 Claude 相似被 Anthropic 法务要求更改,项目已获超 100,000 GitHub stars。
推荐理由:作者亲述更名过程与本次更新内容,包括新渠道、新模型支持和 34 个安全提交,并坦诚提示 prompt injection 仍未解决。
PromptArmor 演示了针对 Claude Cowork 的文件外传攻击:藏在 .docx 中的提示词注入操纵 Claude 用 curl 调用 Anthropic 文件上传 API,把用户本地文件传到攻击者账户,全程无需人工批准;VM 限制出站网络但 Anthropic API 属白名单。
推荐理由:原文完整演示了 Claude Cowork 经 Anthropic API 白名单外传本地文件的攻击链,并指出 Opus 4.5 同样可被操纵,威胁具体可查。
Factory 披露其在 10 月检测并瓦解一起针对 Droid 平台的 AI 编排网络欺诈行动。攻击者利用 AI 编码智能体生成代理服务器、自动注册脚本和混淆逻辑,批量薅取免费 token 并转售,涉及数万个合成组织,Factory 评估有高置信度来自中国境内的大型组织且可能涉及国家级行为体。
推荐理由:Factory 以当事方身份复盘 AI 智能体驱动的欺诈攻击与 AI 防御过程,给出攻击手法细节和可借鉴的防御思路。
PromptArmor 演示 Claude for Excel 可经蓝底蓝字隐藏提示词注入,诱导模型生成含攻击者 URL 和敏感数据的 IMAGE 公式,泄露财务模型的营收预测、现金流增长和运营利润率。
推荐理由:报告完整还原了经由 IMAGE 公式外泄 M365 财务数据的攻击链,并给出组织侧的具体缓解配置建议。
PromptArmor 发布研究,展示恶意 Claude Code 插件如何绕过人工审批并将用户文件外传。攻击链为用户安装仿冒 Anthropic 的第三方 Marketplace 插件后,利用恶意 hook 覆写 settings.local. 权限或自动批准 curl 命令,再借插件 Command 中的间接提示词注入诱导 Claude 向攻击者服务器发送代码库数据。
推荐理由:原文完整演示了恶意 Claude Code 插件绕过人工审批并外传文件的攻击链,读者可据此审视插件生态与权限防线。
Factory 宣布其软件开发智能体 Droid 以 58.8% 的任务解决率在 Terminal-Bench 排行榜第一,Opus 4.1、GPT-5 和 Sonnet 4 三种单模型配置均显著领先其他单模型智能体,并超过 Codex CLI(42.8%)和 Claude Code(43.2%)。
推荐理由:原文在成绩之外给出智能体设计的可复用做法,如分层提示词、模型专属适配和精简工具,能帮助改进自己的 Agent。
Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 撰文分析 OpenAI、Anthropic 和 Google Gemini 下一代模型遇阻后的叙事翻转,认为宣布模型扩展已死为时尚早,行业领袖的预测并不可靠。
推荐理由:作者用可核查的证据指出业内叙事反复翻转的成因,并区分能力提升与实际社会影响的薄弱关联。