Claude Code 推出 mods:用 TypeScript 函数定制和替换内置功能
Anthropic 为 Claude Code 推出 mods,即小型 TypeScript 函数,可改写提示词、拦截工具调用、审批权限请求或添加新 UI。Mods 随插件分发,可在 CLI 和桌面应用使用,内置的 /diff 功能已改为 mod。
推荐理由:官方公布了 mods 的事件机制、企业管控方式和使用入口,开发者可据此决定是否用 mods 定制自己的 Claude Code 工作流。
Anthropic 为 Claude Code 推出 mods,即小型 TypeScript 函数,可改写提示词、拦截工具调用、审批权限请求或添加新 UI。Mods 随插件分发,可在 CLI 和桌面应用使用,内置的 /diff 功能已改为 mod。
推荐理由:官方公布了 mods 的事件机制、企业管控方式和使用入口,开发者可据此决定是否用 mods 定制自己的 Claude Code 工作流。
Claude Code 发布 v2.1.287,新增 Claude Mods 插件机制和内置 mod "You should know",Opus 4.7+ 与 Fable 在 Bedrock、Vertex、Foundry 等默认使用 1M 上下文窗口。另修复大量问题,包括 rm 危险命令保护、屏幕阅读器模式和 VSCode 扩展的多项缺陷,并改进 Bash 速度与 MCP 权限提示展示。
OpenRouter 发布教程,讲解用固定的 eval 集合在 GitHub Actions 中门禁 PR,当 pass rate 低于阈值时阻止合并。
推荐理由:OpenRouter 官方给出可落地的 CI eval 门禁方案,包含阈值测量和 provider 路由等易踩坑细节,方法可直接迁移到自己的仓库。
Apple 研究团队提出 RLTL;DR,让策略在每次失败后根据验证器输出自行撰写一条 TL;DR 式反馈,并将上下文中的洞察反向传播以内化“任务→洞察”映射。
Apple 与 EPFL 研究者发表论文,比较开源 SOTA MLE agent harness 与最小 harness 的单会话 coding agent。在相同时间预算和同一前沿 LLM 骨干下,复杂 harness 并无优势,性能主要取决于模型骨干;大规模消融实验显示多层机制在 coding agent 场景中变得冗余。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先向 Fairwind Program 的可信网络防御者开放,后续将面向开发者、企业和消费者推出。
推荐理由:官方博客给出定价、输出上限和多个基准成绩,可帮读者评估该模型在编码与安全防御场景的实际定位。
Claude Code v2.1.286 发布,权限提示新增“2 of 5”计数,全屏列表的“N more”行支持鼠标点击跳转。本次修复涵盖多进程重复打开登录浏览器、claude --resume 与 --continue 丢失并行工具调用轮次、工具返回对象或数字导致的 API 400 错误,以及云会话因容器停止而无法唤醒等问题。
LangChain 为其开源编码 Agent Open SWE 构建了模型路由器,在 973 条线程的 A/B 测试中,相比始终使用 GPT-6 Astra,中位成本从 $2.61 降至 $0.94(降 64%),PR 合并率无显著差异(29.2% vs 27.3%,p=0.49)。
推荐理由:作者用自身 Open SWE 的 A/B 数据说明路由放在 harness 内的理由和成本收益,方法可迁移到其他多任务 Agent。
物理学家 Matthew Schwartz 发文介绍一种 AI 加速科研的新思路:不再对抗模型短板,而是寻找适合当前 LLM 的 "Claude-shaped" 问题,并开源了定量科学计算工具包 BootLoops。
推荐理由:作者复盘了寻找 AI 擅长问题并联合领域专家雕琢结果的完整方法,这套协作模式对科研用户可直接借鉴。
Barclays 扩大与 Anthropic 的战略合作,在全行范围部署 Claude,用于加速软件开发、现代化遗留系统并提升运营效率,预计到 2026 年底 Claude Code 覆盖 50% 开发者,2027 年覆盖多数软件工程师。
Claude Code v2.1.285 新增 CLAUDE_CODE_DISABLE_WEB_FETCH 环境变量以关闭 WebFetch 工具,并支持 claude --desktop 在当前目录打开 Claude 桌面应用。
Anthropic 宣布 Claude for Government 面向美国联邦与州级机构正式可用,该平台通过 FedRAMP High 授权环境提供 Claude 的编码与智能体工作能力,此前自 7 月起处于公开测试阶段。
OpenAI 发布 GPT-6.1 Sol,定位为接近 Astra 智能水平的模型,主打编码、计算机使用和专业工作场景,价格为 Astra 标准 API 输入和输出 token 价格的五分之一。
推荐理由:原文明确了模型定位与五分之一的价格对比,读者可以据此评估在不同工作负载下替换现有模型API的成本空间。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,支持 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过跨区域推理配置在 bedrock-runtime 端点提供服务,兼容 Responses、Chat Completions 和 Converse API。
Databricks 介绍其通过 Unity Gateway 让全体员工在 Opus 5.5、GPT-6 Sol 和 GPT-Luna 发布首日即获得实验性访问的完整流程:先用实验标签和按用户预算(月度上限、每日 runaway 限额、质量前沿预算、实验预算四类)控制风险,再依据内部基准、用户反馈和 OpenTelemetry 成本追踪评估。
推荐理由:原文给出企业内部让全体员工 Day 1 用上新模型的完整流程和成本数据,方法可迁移到类似的模型接入评估场景。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 可用,定位为更聪明高效、多数任务单次成本更低且速度更快的编码与知识工作模型。
推荐理由:官方介绍了 Sonnet 5.5 在 Bedrock 的能力定位、与 Opus 5.5 的分工和入门调用方式,方便评估接入路径。
Claude Code v2.1.284 新增 Claude Sonnet 5.5(claude-sonnet-5-5),作为 Anthropic API 默认 Sonnet 模型,支持 1M 上下文,定价 $2/$10 per Mtok、缓存读取 $0.20/Mtok。
Google Earth Engine 推出新功能 Ask,将 Gemini 能力直接集成进 Code Editor,用户可用自己的 Gemini API key 编写、调试、理解和优化地理空间查询。
OpenAI 启动 Codex Originals 项目下一阶段,征集使用 Codex 的开发者、研究者与创作者的真实故事和项目。参与者需提交自己的故事与项目介绍,入选者将参与该项目的新篇章。
Anthropic 发布 Claude Sonnet 5.5,为 Claude 5.5 家族第二款模型,生成速度比 Sonnet 5 快 30% 以上,测试中单任务成本最多低 30%。
推荐理由:官方发布给出了与 Sonnet 5 和 Opus 5.5 的多项基准对比、定价和成本数据,读者可以据此判断它在自己场景下是否值得迁移。
Proaction 使用 Codex、GPT-Live-1 和 GPT-6 Astra 构建、运营并销售现代车队管理服务,实现销售额提升 60%、节省 75+ 小时。
GitHub Copilot 博客作者提出聊天(chat)很多时候是错误的 AI 交互界面,介绍 GitHub Copilot app 中的 canvas,它是在应用内运行、无浏览器外壳的全栈小应用,可与 Copilot agent 双向通信。
推荐理由:作者作为 Copilot 团队成员提出用 canvas 自定义界面替代聊天框,并结合工作流自动化等实例说明何时值得让智能体先造工具。
Claude Code 发布 v2.1.282,新增 maxProseWidth 设置,可限制宽终端中 Claude 正文宽度,表格与代码块仍保持全宽。该版本还新增启动提示及 /status、claude doctor 条目,列出项目设置文件中被忽略或关闭遥测的变量,并修复了会话续接重发旧消息、扩展思考丢失及多处 API 报错等问题。
GitHub Security Lab 的 Antonio Morales 基于自家的 Taskflow Agent 框架构建了 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线。
推荐理由:原文给出完整的架构设计、覆盖反馈循环和分层判断方法,读者可以据此把 LLM 智能体接到自己的模糊测试流程里。
inclusionAI 正式开源 Ling 2.0 架构下的第三个 MoE 大语言模型 Ling-flash-2.0,总参数 100B、激活参数 6.1B(非嵌入 4.8B),基于 20T+ tokens 数据训练并经 SFT 和多阶段强化学习。
推荐理由:官方给出参数结构、基准对比和推理速度数据,读者可据此评估小激活 MoE 替代 40B 稠密模型的可行性。
inclusionAI 开源 Ling 家族旗舰模型 Ling-2.6-1T,参数量达 1T,面向复杂推理、编码和 Agent 工作流。
推荐理由:官方发布万亿参数旗舰开源模型,给出架构设计、benchmark 结果和 SGLang/vLLM 部署细节,便于评估其实际可用性。
inclusionAI 在 Hugging Face 发布 Ling-3.0-flash,为原生混合线性注意力 MoE 模型,总参数 124B、每 token 激活 5.1B,约为此前 1T 级旗舰 Ring-2.6-1T 的 12.4% 和 8.1%,官方称在关键基准上持平或超越前代。
Claude Code v2.1.281 为 Claude apps gateway 新增 Bedrock upstream 的 assume_role 与 guardrail 配置,并支持在 settings.json 中设置 "attribution": false 隐藏提交与 PR 署名。该版本还修复了会话恢复时重发历史、提示缓存丢失、代理中断流被误判为完成等多项问题。
Cursor 官方博客介绍其智能体 harness 的多项 token 效率优化,整体将用户 token 成本降低 7% 且质量未下降。
推荐理由:Cursor 自述其 harness 层的多项 token 优化手段与量化收益,读者可以借鉴这些方法来降低长时智能体运行成本。
Cursor 推出 Rollouts 和 Security Reviewer 两款软件开发 Bots。
推荐理由:官方说明了两款 Bot 的具体工作机制和启用入口,读者可以对照自身部署与安全审查流程评估适用性。
Google 宣布 Antigravity SDK 支持本地工作流,首发支持通过 Google AI Edge 的 LiteRT 运行 Gemma 4 26B A4B,可完全离线提供智能体能力,建议机器配备 24GB 以上 VRAM 或统一内存。
推荐理由:原文给出本地运行智能体的具体配置方法和混合编排演示数据,开发者可以直接照此把智能体工作流搬到本地 GPU 上。
Claude Code v2.1.280 加入 Claude Opus 5.5(claude-opus-5-5)作为默认 Opus 模型,1M 上下文,$4/$20 per Mtok,cache reads $0.20/Mtok;Pro 和 Team Standard 计划默认模型由 Sonnet 改为 Opus。
推荐理由:发布日志列出 Opus 5.5 成为默认模型及其定价上下文,并包含大量修复与 VSCode 新对话框,读者可对照更新自己的工作流。
Anthropic 前线部署工程师在 Notes from the Field 系列中分享管理大规模代码现代化项目的经验:原本需数年的项目现在可在数月或数周内完成,但瓶颈从编写变更转移到组织动员。
推荐理由:来自 Anthropic 一线工程师的实战经验,给出 AI 代码现代化项目启动前的组织性准备工作清单和可复用六步流程。
CodeRabbit、Power Digital 和 ThoughtSpot 通过 Claude Marketplace 用已有的 Anthropic 承诺额度扩容 Vercel 和 Snowflake。
Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 家族首款模型,官方称其表现与 Claude Fable 5.1 相当,运行成本较 Opus 5 降低 40%,输入和输出 token 价格为 $4 和 $20 每百万,缓存读取 $0.20 每百万(降低 60%),输出速度快 30% 以上。
推荐理由:官方给出完整基准、价格与安全评估细节,读者可据此比较 Opus 5.5 在成本与智能体编码上的实际变化。
Anthropic 发布 Claude Opus 5.5(claude-opus-5-5),面向长时运行的智能体编码与知识工作,默认 1M token 上下文窗口。
推荐理由:官方发布说明列出了价格、上下文窗口和 API 行为变化,可为长期智能体编码工作流的迁移提供具体参考。
Linear 因 AI 智能体加速写代码使 CI 成为瓶颈,系统性改造后把 PR 等待时间从 6 分多钟降到 5 分多钟,单个测试的 runner 时间约减半。
推荐理由:原文给出完整的 CI 优化路径和各步骤量化收益,其他团队可对照迁移到自己的流水线。
Claude Code v2.1.278 将 Claude API、Enterprise 用户以及 Bedrock、Vertex、Foundry 和网关上的 Auto 模式默认切换为服务端分类器,该分类器不收取分类器开销费用。
Claude Code v2.1.277 新增 AGENTS.md 支持:项目中没有 CLAUDE.md 时会改读 AGENTS.md,可在 /config 的 "Project instructions" 中修改,但 Bedrock、Vertex 和 Foundry 暂不支持。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的专家经验,后者为智能体提供连接工具和数据的标准接口,二者可组合使用。RAG 并未消亡,它让模型获取训练数据之外的信息,减少 token 浪费并降低答案不完整的概率。