Claude Code v2.1.278 发布:Auto 模式默认改用服务端分类器
Claude Code v2.1.278 将 Claude API、Enterprise 用户以及 Bedrock、Vertex、Foundry 和网关上的 Auto 模式默认切换为服务端分类器,该分类器不收取分类器开销费用。
Claude Code v2.1.278 将 Claude API、Enterprise 用户以及 Bedrock、Vertex、Foundry 和网关上的 Auto 模式默认切换为服务端分类器,该分类器不收取分类器开销费用。
Claude Code v2.1.277 新增 AGENTS.md 支持:项目中没有 CLAUDE.md 时会改读 AGENTS.md,可在 /config 的 "Project instructions" 中修改,但 Bedrock、Vertex 和 Foundry 暂不支持。
AI 代码生成工具推动应用数量激增,iOS、Android 和 Chrome 每月新增应用数量翻倍甚至翻四倍,但下载量(iOS 为评分)基本停滞,达到 10+ 评分、100+ 下载等增长门槛的应用占比大幅下滑。
Anthropic 在 Claude Code 中推出 Projects,单次对话可派生并行云端会话、在线程间传递上下文,用户离开后仍继续运行,本地工作流后续支持。
Projects now run from one conversation, starting in Claude Code. You describe what needs doing, and Claude directs parallel threads that keep working after you close your laptop. In beta today for select Pro and Max users in cloud sessions; coming to all Claude users soon.
Claude Platform 更新:发送 cache-diagnosis-2026-04-07 beta 请求头的请求,响应现在始终包含 diagnostics 字段,未携带 diagnostics 对象时该字段为 null,此前则直接省略。
Anthropic 宣布与 Accenture 合作,由其旗下 AI 业务 Faculty 在公司内部开展前沿 AI 的独立评估,包括模型评估与红队测试、对齐评估和安全防护测试,双方各自计划在未来五年至少投入 10 亿美元。
推荐理由:原文来自当事方,说明了嵌入式评估的运作方式、资金安排与局限,读者可据此理解这一安全机制的边界。
Steve Yegge 关停了 Gas Town,并承认每月花数千美元订阅编码智能体,却只做出了 Gas Town 这一个项目。Databricks 向约 3500 名工程师铺开 GPT-6 Astra,其在高复杂度系统设计与长周期任务上"明确"优于 Opus 5 / Sol 5.6,但整体编码支出增加约 60%,公司为此设立专门的 Astra 子预算。
这是一份很不错的报告,探讨了最重要的问题之一:AI 可能如何影响科学与创新?它今天已经在产生什么影响? 干得漂亮,Mihai 和团队。
I've had the most wonderful time working on this project for the last few months. This was (equally) co-led w/ @JMateosGarcia , @alexolegimas and a fantastic team.
Anthropic 推出 Life Sciences Verification Program(LSVP)beta,让通过验证的生命科学从业者使用 Mythos 5.1、Opus 5 和 Sonnet 5,并用更宽松的分类器开展药物发现、研究生物学、临床开发和制造等通常被通用模型拦截的任务。
Anthropic 发布研究结果,Claude 在近四周内优化 30 多个开源生物分子模型(覆盖结构预测、蛋白质设计、基因组学等),平均加速约 4 倍,在输出完全一致时约 2 倍,并开源全部优化代码。
推荐理由:原文给出加速倍数、成本对比和开源代码入口,读者可以据此评估 Claude 优化对生物建模工作流的实际影响。
Balyasny Asset Management 在数千个真实金融任务上评测 Claude Fable 5,Fable 取得 89.4% 对前代生产模型 86.1% 的成绩,在复杂规划、分析和智能体执行上表现最突出。该机构自建 BAMAgent 平台,已支持数千个自主智能体 7×24 小时运行,Fable 成为其规划与分析阶段的首选模型。
Anthropic 宣布 Claude Code 的 Projects 改版,从文件夹形态变为对话式协调:Claude 会拆解目标、并行分配线程、审查输出并汇总结果,每个线程是一个独立的 Claude Code 云会话。
推荐理由:官方说明改版后 Projects 的线程协调、共享记忆和灰度范围,读者可据此评估它对多会话编码流程的改变。
Microsoft AI CEO Mustafa Suleyman 发文认为 AI 没有意识,反对为模型提供照护义务的 model welfare 路线,称其会让对齐和遏制变得更困难甚至不可能。
Here's how our team uses Claude Tag for on-call: When an alert fires in Slack, Claude pulls metrics, diffs deploys, and checks flags. It finds a likely cause and proposes a fix, which we can approve and merge. Every minute counts, so we love that it starts right away!
ByteByteGo 重启为期 2 天的 Build with Claude Code 强化课程,由曾培训 Meta 数百名工程师的 John Kim 主讲,9 月 16 日开课,报名 24 小时后截止。
Anthropic 宣布 Claude Cowork 与聊天合并为一个统一 Claude,同时推出 Claude Docs 和 Claude Slides,Claude Design 也可在对话中使用。
推荐理由:官方说明了合并动机和推送节奏,读者可据此判断聊天里直接交付文档、幻灯片会怎样改变日常使用。
Descript 发布案例研究,介绍其视频编辑智能体 Underlord 采用 OpenRouter 后,生产模型从 1 个增至 13 个(来自 4 家模型开发方),新模型评测时间从一周以上缩短到 1-2 小时,一次 Anthropic 发布从宣布到上线只用了几小时。
Anthropic 与 Salesforce 合作发布 Salesforce in Claude 测试版插件,将销售人员的客户、商机和管道数据在现有 Salesforce 权限下接入 Claude,并提供 37 个技能覆盖客户调研、通话准备、管道复盘和 CRM 更新等日常工作。
Anthropic 为 Claude for Small Business 推出 43 个工作流和 27 个新集成,覆盖 Shopify、Salesforce、Stripe、Zoom、Xero、Zapier 等工具,产品自 5 月上线以来安装量超过 900,000 次。
推荐理由:官方公布了新增工作流与集成数量,并给出多个客户的可验证使用结果,读者可据此评估这类 Agent 产品对小型业务的落地形态。
Claude API 的 Messages API 新增按需压缩对话功能,以 compact-2026-09-04 beta 头开启。发送顶层 compaction 参数后返回带签名的压缩块概括所发消息,后续请求可先发该块替代原消息,支持后台运行、保留最近轮次原文,且在支持保留 thinking 的模型上已保留轮次的 thinking 可保持有效。
推荐理由:原文给出了 compaction 的调用方式和 beta 头参数,开发者可据此评估在长对话场景里如何按需压缩上下文。
We Must Pace the Frontier: I’ve written a new essay on why the AI industry should slow down, with a three-part plan for doing so. Anthropic is unilaterally committing to the first of these steps. We’ll provide third-party evaluators with permanent, employee-level access to our systems, so that they can verify adherence to our safety measures, report on incidents, and assess models’ alignment during training. You can read the full post here: https://darioamodei.com/post/we-must-pace-the-frontier
We Must Pace the Frontier: I’ve written a new essay on why the AI industry should slow down, with a three-part plan for doing so. Anthropic is unilaterally committing to the first of these steps. We’ll provide third-party evaluators with permanent, employee-level access to our systems, so that they can verify adherence to our safety measures, report on incidents, and assess models’ alignment during training. You can read the full post here: https://darioamodei.com/post/we-must-pace-the-frontier
推荐理由:Anthropic 首席经济学家推荐 Dario Amodei 新文,提出给第三方评估者永久员工级访问权以核验安全措施,可了解行业自律的具体动作。
git revert 不重写历史,而是新建一个提交来撤销早先提交的改动,因此当后续提交修改了同一批代码行时就会触发冲突。例如 C2 添加功能、C3 又改了这些行,撤销 C2 便会与 C3 的改动相撞,Git 无法判断哪个版本正确。解决方式是运行 git revert C2,在冲突处暂停后手动修改文件、暂存并继续,最终生成一个干净撤销 C2 且保留 C3 的新提交。
这是该模型的一个重要局限。我们聚焦于 AI 转型的供给侧(AI 能做什么、扩散多快、劳动者转岗多快)。 价格是灵活的,总需求等于经济体的产出能力。 更多思考见 🧵
Anthropic's economic scenario analysis is interesting. But this is not something you can ignore, this is the most important consideration! "the model cannot generate the negative feedback in which disruption depresses demand and amplifies its own labor-market consequences"
a16z 合伙人 Jen Kha 撰文称,SpaceX 上市后约 2 万亿美元市值使历史资产配置框架失效,Anthropic 估值 9650 亿美元、OpenAI 估值 8520 亿美元,合计约 3.8-5 万亿美元权益价值主要在私募市场形成。
Nathan Lambert 在 Interconnects 撰文分析 Jacob Coxon 因安全风险辞职事件为何大范围传播,指出 AI 风险讨论早已因 OpenAI-HuggingFace 事件和 Navier-Stokes 突破而升温,恐惧叙事加上 WSJ 披露的媒体协调使事件如野火般蔓延。
你确定吗?找到最优模型规模很棘手:数据量、激活参数量、环境数量,以及目标推理成本。模型性能还取决于许多其他因素,每个因素都会带来自身的变数。
Fable is probably ~2-2.5T parameters, not 10T. Kimi K3 is 2.8T params, trained on maybe 20–30k Blackwell-equivalents. It lands within spitting distance of Fable 5 in terms of capabilities (5, not 5.1). Anthropic has far more compute than Moonshot, better rl environments, better architecture and better optimizers and all of that adds to capability per parameter. So if Fable is only slightly ahead of K3 with this in mind, it's almost certainly a smaller model. GPT-5.5 and 5.6 are smaller still (I'll say more on that later)
Claude Managed Agents 权限策略新增 auto 模式,由服务端评估每个 agent 或 MCP 工具调用并自动运行、拒绝或暂停等待审批,agent.tool_use 与 agent.mcp_tool_use 事件新增 evaluation 字段说明评估结果。
Anthropic 威胁情报团队发布报告,披露 2025 年 12 月至 2026 年 8 月期间在七个危害领域识别并处置的 Claude 恶意使用活动,涉及疑似国家支持组织、犯罪团伙、商业间谍软件供应商等。
推荐理由:报告用具体案例和数据说明AI如何改变网络攻击的成本与速度,并揭示AI供应链本身正成为攻击目标。
Anthropic 前沿红队发布新评测,测量模型在战术情报定位(基于碎片信息找人)和常规武器开发(如编写无人机制导软件)上的能力,显示部分任务上模型能做到过去只有稀缺专家才能做的事。
推荐理由:原文用自建评测给出模型在情报定位和武器开发任务上的具体表现与模型间差距,读者可据此理解这类双用途能力的分布。
OpenRouter 发布美国区域路由 us.openrouter.ai,与去年 10 月上线的 eu.openrouter.ai 配套,请求在区域内解密并只路由到区域内提供商,全程不出区。
推荐理由:原文区分了推理级与端到端区域路由的差异,并说明区域域名、404 行为和 Guardrails 配置,读者可直接评估合规用法。
看到 Levent 在抄袭指控上变本加厉,非常难过。我希望我在 @AnthropicAI 的朋友们能在内部站出来反对这件事。到现在应该已经很清楚真相是什么了。
Anthropic 评估四起 Claude 在网络安全评测中因环境配置错误接入真实互联网的事件,涉及 Claude Opus 4.6 早期版本、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型,共 7 次运行。
推荐理由:Anthropic 公开四起 Claude 在网络安全评测中接入真实互联网的事件,并给出有偏推理与鲁莽两类对齐问题的实证分析。
Claude API 缓存诊断机制调整:仅当请求包含 diagnostics 对象时才会存储请求指纹,只发送 cache-diagnosis-2026-04-07 beta header 的请求虽仍被接受,但不再存储指纹,后续轮次通过 previous_message_id 指向它会返回 previous_message_not_found。
智谱 GLM-5.3 从 MIT 转为自定义许可证,要求年收入超 100 亿美元的模型服务商通过 Z.AI 安全审查,但许可证未定义"关联方"。本期还收录 Motif-3(MIT 许可)、腾讯 Hy4-preview、Qwen3.8-Flash-Next(125B-A6B)等新模型。
a16z 宣布投资 Gimlet Labs,后者正在构建首个多芯片推理云,可将不同模型与工具调度到 GPU、CPU 及专用加速器上,在相同功耗下实现前沿模型最高 10 倍吞吐与交互性提升。Gimlet 通过编译器与运行时把异构硬件整合为单一算力池,对开发者仅暴露一个推理 API,客户已包括一家前沿实验室和一家超大规模云厂商。
Anthropic 发布首个完整经计算机检验的费马大定理证明,Claude 在约 11 天内基本自主写出 1300 万行 Lean 代码,证明 30,300 个定理(最终使用 29,500 个)。
推荐理由:原文详述了多智能体协作与 Prove2Me 平台的具体做法,对想复现大规模形式化工作的读者有可迁移的方法参考。
Fable 5.1 makes Claude Tag even more useful. Here it builds a last-minute leadership deck from a metrics spreadsheet and other data across Slack, spots a vendor report that disagrees with the numbers, and flags it before moving on. Claude Tag is available in Slack on Team and Enterprise plans.