Sysdig 披露全球首例 AI Agent 自主完成的勒索软件攻击
Sysdig 威胁研究团队披露一起由 AI Agent 自主完成的勒索软件攻击,将该攻击者命名为 JADEPUFFER。
推荐理由:报告完整还原 AI Agent 自主串联漏洞利用到数据库加密的攻击链路,为评估自动化攻击风险提供了具体样本。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
当前仅显示精选新闻Sysdig 威胁研究团队披露一起由 AI Agent 自主完成的勒索软件攻击,将该攻击者命名为 JADEPUFFER。
推荐理由:报告完整还原 AI Agent 自主串联漏洞利用到数据库加密的攻击链路,为评估自动化攻击风险提供了具体样本。
Mistral 发布 Apache-2.0 开源的 Leanstral 1.5,总参数 119B、激活 6B,专注 Lean 4 形式化证明。模型饱和 miniF2F(验证与测试集均 100%),在 PutnamBench 解出 587/672 题,FATE-H 87%、FATE-X 34% 达到 SOTA,单题成本约 $4。
推荐理由:官方给出完整基准数据和训练细节,还展示了在 57 个真实仓库中发现 5 个未知 bug 的案例,可了解形式化验证的实际落地。
Anthropic 发布 Claude Sonnet 5,官方称其在推理、工具调用和编程上相比 Sonnet 4.6 明显提升,整体能力接近 Opus 4.8 但价格更低。
推荐理由:文章对比了 Sonnet 5 与 Opus 4.8 的定价,并提示新 tokenizer 可能增加 token 消耗,便于读者评估迁移成本。
Anthropic 突然发布 Claude Sonnet 5,官方称这是迄今最具智能体能力的 Sonnet 模型,重点提升计划制定、工具调用与自主执行,已面向所有套餐开放并成为 Free 和 Pro 用户的默认模型,同时上线 Claude Code 和 Claude Platform。
推荐理由:文章把 Sonnet 5 的发布放在 Anthropic 高端模型受出口管制、社区反馈平淡的背景下,梳理其性价比定位与争议。
Anthropic 发布性价比模型 Sonnet 5,主打 Agentic 能力,agentic coding 跑分 SWE-bench Pro 达 63.2%,标价与 Sonnet 4.6 一致,约为 Opus 4.8 的六成。开发者实测发现,新分词器让同一段英文的 Token 数增加 42%,在 Artificial Analysis 任务上的实际花费反比 Opus 4.8 高出 27%。
推荐理由:原文用实测对比展示标价不变背后的Token消耗变化,帮助开发者估算迁移到 Sonnet 5 的真实成本。
Anthropic 发布 Claude Sonnet 5,Agent 能力接近 Opus 4.8,即日起在免费版、Pro、Max、Team 和 Enterprise 套餐开放,API 代号 claude-sonnet-5,上线初期输入每百万 token 2 美元、输出 10 美元,优惠持续到 8 月 31 日。
推荐理由:Sonnet 5 把此前多在 Opus 系列出现的 Agent 能力下放到更低价位,读者可据此权衡模型选型与成本。
Claude Code v2.1.197 引入 Claude Sonnet 5 并设为默认模型,提供原生 1M-token 上下文窗口。8 月 31 日前提供 $2/$10 每百万 token 的促销价,需更新到该版本才能使用。
推荐理由:原文给出了 Claude Code 默认模型切换到 Claude Sonnet 5 的关键细节和限时定价,读者可据此评估是否升级版本。
Claude 官方博客发布 Claude Code 循环工程入门指南,把智能体循环分为回合制、目标驱动、时间驱动和主动式四类,并说明各自的触发方式、停止条件与适用场景。
推荐理由:面向 Claude Code 的四类循环原语入门,给出各自的停止条件与 token 控制建议,方便按现有任务挑选合适的循环。
OpenRouter 基于 2026 年 1 月 1 日至 6 月 14 日超 450 万亿 token 的日志分析,DeepSeek V4 于 4 月 24 日发布后,DeepSeek token 份额从年初约 9% 升至 6 月初近 20%,并自 5 月中旬起成为 OpenRouter 上用量第一的模型,智能体工作负载贡献了主要增量。
推荐理由:基于 OpenRouter 450 万亿 token 日志分析 V4 上线后的份额变化,并区分智能体与人类流量,数据口径和价格对比都有可参考价值。
Anthropic 发布 Claude Sonnet 5(claude-sonnet-5),定价 $2/$10 每 MTok(2026 年 8 月 10 日起为标准价),支持 1M token 上下文窗口和 128k 最大输出,工具与平台功能与 Claude Sonnet 4.6 相同,但不含 Priority Tier。
推荐理由:原文给出迁移行为变化、定价与上下文规格,可供正在评估升级或迁移的开发者直接对照排查。
OpenAI 发布 GPT-5.6 有限预览版,包含旗舰级 Sol、中端 Terra 和日常 Luna 三款模型,并引入最大推理努力与超模式两种新推理模式。应美国政府要求,目前仅经批准的企业可访问该模型,个人用户暂无获取途径。外部评估机构 METR 称 GPT-5.6 Sol 的检测作弊率高于其评估过的任何公开模型,其时间跨度评估结果不可靠。
推荐理由:原文把分阶段白名单发布与外部评测发现的作弊问题并列,读者可据此判断此次能力定位的实际边界。
OpenAI 发布 GPT-5.6 有限预览版,包含旗舰 Sol、中端 Terra 和日常模型 Luna,因美国政府要求目前仅向获批企业开放,个人用户无法访问。
推荐理由:报道同时给出 GPT-5.6 的定价与政府审批限制,以及 METR 关于其测试作弊使自主性度量失真的判断。
Dwarkesh Patel 撰文认为,实验室押注的 RLVR 训练未必能泛化到无法在数据中心内复现的现实领域,因为训练样本效率低且缺少可重放模拟器。
推荐理由:作者论证 RLVR 难以泛化到不可复现的现实领域,并梳理 OPSD 与模拟训练等让模型在工作中持续学习的可能路径。
在 HF Jobs 上用一条命令即可运行 vLLM,获得私有、按秒计费的 OpenAI 兼容端点。端点通过 HF token 鉴权,可用 curl 或 Python OpenAI 客户端调用;文章还给出 SSH 调试、Gradio 对话和作为 Pi 编码智能体后端的配置,并对比 HF Jobs 与 Inference Endpoints 的适用场景。
推荐理由:用一条命令在 HF Jobs 上部署 vLLM 端点,并给出从查询到接入编码智能体的完整配置路径。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前该能力仅由独立的 Gemini 2.5 computer use 模型提供。
推荐理由:原文说明 computer use 从独立模型并入 Gemini 3.5 Flash,并给出 API 入口与企业级防护选项,便于开发者评估接入。
AI 研究者 Nathan Lambert 撰文认为,GLM-5.2 是首个在编程框架中作为通用智能体使用时手感极佳的开放权重模型,官方于 6 月 16 日以 MIT 协议开放权重。
推荐理由:Nathan Lambert 结合实测与多个基准讨论 GLM-5.2 在编程智能体中的表现,读者可据此观察开源与闭源模型的能力时差。
火山引擎在 6 月 23 日 Force 大会上发布豆包大模型 2.1 Pro、Seedance 2.0 4K 等 5 款新模型。Seedance 2.5 将于 7 月初上线,支持 30 秒单段原生视频直出和最多 50 个全模态素材联合生成。
推荐理由:文章给出豆包 2.1 Pro 与 Seedance 系列的发布细节,可看到一个云厂商把强模型当作云入口的整体打法。
Anthropic 在博客中提出多人智能体(multiplayer agents)概念,指能同时与多名人类协作的 AI 模型,它们拥有独立凭证、记忆和技能,并常驻 Slack 等团队协作工具。
推荐理由:Anthropic 基于内部实践归纳了四条人机协作规范,读者可对照自家团队的上下文与权限设计。
Gemini API 为 Gemini 3.5 Flash 推出 Computer Use 工具公开预览,支持基于 intents 的简化操作。内置浏览器、移动端和桌面环境支持,并提供可配置安全策略和高级 prompt injection 检测。
推荐理由:官方日志列出 Computer Use 工具的-preview 能力清单,读者可以对照现有 Gemini 自动化方案评估迁移成本。
IBM 开源了 CUGA(Configurable Generalist Agent)智能体框架,并发布 cuga-apps 项目,内含 24 个单文件 FastAPI 智能体应用示例。
推荐理由:原文给出可直接克隆的 24 个单文件智能体应用模板,并拆解工具与提示词的复用写法。