Anthropic 移除 Claude Opus 4.6 快速模式
Anthropic 已移除 Claude Opus 4.6 的快速模式,请求 claude-opus-4-6 时带 speed: "fast" 不再以快速速度和溢价计费,而是按标准速度运行、按标准费率计费且不报错,响应中的 usage.speed 字段会报告实际使用的速度。要继续使用快速模式,需迁移至 Claude Opus 4.8。
Anthropic 已移除 Claude Opus 4.6 的快速模式,请求 claude-opus-4-6 时带 speed: "fast" 不再以快速速度和溢价计费,而是按标准速度运行、按标准费率计费且不报错,响应中的 usage.speed 字段会报告实际使用的速度。要继续使用快速模式,需迁移至 Claude Opus 4.8。
十字路口播客对话越伴动力创始人世博,介绍其发布的陪伴机器人小伴。产品不发人话而用类似外星语的声音,全身90%以上为柔软材质,采用端侧快脑1.7B、慢脑7B的快慢脑分工加云端超长程记忆,把交互延迟压到0.4秒以内。世博提出陪伴不是讨好、生命力不是可爱、少就是多的产品判断,并谈到创业时机与家庭机器人基座加情感交互模型基座两项基座能力。
OpenRouter 认为 2026 年 6 月最值得关注的四款开放权重模型是 DeepSeek V4 Flash、GLM 5.2、MiniMax M3 和 NVIDIA Nemotron 3 Ultra,并指出开放权重模型与美国前沿实验室的能力差距已连续 18 个月保持在 3-6 个月且未在扩大。
推荐理由:OpenRouter 用自家价格与吞吐数据逐一点评四款开放权重模型的适用场景,读者可以按成本、质量和模态对号入座选型。
Google Research 推出新架构,将多 Token 预测(MTP)头挂载到已冻结的 Gemini Nano v3 上,在 Pixel 9 上实现 50% 以上的推理加速。
Dwarkesh Patel 撰文认为,实验室押注的 RLVR 训练未必能泛化到无法在数据中心内复现的现实领域,因为训练样本效率低且缺少可重放模拟器。
推荐理由:作者论证 RLVR 难以泛化到不可复现的现实领域,并梳理 OPSD 与模拟训练等让模型在工作中持续学习的可能路径。
拥有超 3000 万粉丝、50 亿次播放的洛杉矶舞者兼 DJ Matt Steffanina 表示,自己曾围绕他人音乐积累数十亿播放量,却不拥有任何底层资产,直到开始创作并拥有与内容相关的音乐才拿回长期控制权。他透露用 Suno 把音乐创意从数天缩短到几分钟落地,并称 Suno 与 Hooks 更聚焦创作者,让创作过程重新变得像玩一样。
纽约钢琴家兼作曲家 Eric Christian 在 Suno 博客专访中表示,Suno 是他创作新旋律时的最后一道检验,能在几秒内听到作品真正想要的交响效果,而过去做管弦乐 mockup 要花数小时。他已在 200 个国家售出超 10 万份乐谱,并称自己是最早在 Hooks 上认真创作的古典作曲家之一。面对质疑 AI 工具的古典音乐人,他的态度是“要么适应,要么被淘汰”。
SGLang 为 DeepEP MoE 推理引入两种调度期负载均衡方案:面向共享专家的 Waterfill 和基于线性规划、针对冗余专家副本的 LPLB。
Anthropic 上调 Claude API 速率限制,Claude Sonnet 和 Claude Haiku 的限额在所有用量层级上与 Claude Opus 持平,用量层级合并为 Start、Build、Scale 三档。多数组织将升至更高层级,没有组织的限额低于此前,且无需任何操作,可在 Claude Console 查看当前层级与限额。
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小。在 Spanner 生产环境测试数月后,内存用量降低 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。
Runway 发布 Agent 2.0,一款面向营销人员的升级版智能体,已向所有用户开放。用户可在对话中导入广告投放、产品发布或目标受众等信息,Agent 会分析并提问,协助生成和优化营销内容。它支持从 Meta、YouTube、TikTok、Google 导入广告指标,并自动输出 9:16、16:9、1:1 等平台适配格式。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前该能力仅由独立的 Gemini 2.5 computer use 模型提供。
推荐理由:原文说明 computer use 从独立模型并入 Gemini 3.5 Flash,并给出 API 入口与企业级防护选项,便于开发者评估接入。
Suno 推出名为 Spark 的孵化计划,面向独立音乐人提供资助、导师指导和专属营销支持。入选者还可参加写作营与成熟艺人合作,并对 Suno 新功能提供反馈,同时保留作品的创作控制权和商业权利。该计划即日起开放申请。
Anthropic 已弃用 Claude Opus 4.7 的 fast mode,并将于 2026 年 7 月 24 日移除。移除后,向 claude-opus-4-7 发送 speed: "fast" 的请求将返回错误,官方建议迁移至 Claude Opus 4.8 的 fast mode。
Mistral 为 Connectors 推出多项新能力:按 workspace 或组织管理连接器访问、可单独开关工具的管理员控制(GA),带连接器权限范围的 API key(GA),以及支持多账号登录的连接器(GA)。
Mistral 发布 Mistral OCR 4,除提取文本外还返回边界框、块类型分类(标题、表格、公式、签名等)和逐页逐词的内联置信度分数,支持 170 种语言、10 个语言组。
推荐理由:官方说明了新模型的结构化输出能力、基准得分及其已知评分缺陷,并给出 API 与 Document AI 的选择规则,便于读者判断适用场景。
Nathan Lambert 撰文认为 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可开源的 GLM-5.2,是首个在编码智能体场景中真正好用的开源权重模型,社区评测显示其在 Arena 智能体榜单上是唯一能与 OpenAI 和 Anthropic 最新模型抗衡的开源模型。
推荐理由:作者以亲测和社区评测为依据,把 GLM-5.2 与 DeepSeek R1 时刻类比,并展开开源与闭源差距及监管风险的独特分析。
本期Import AI汇总:牛津、UK AISI、斯坦福等机构研究显示AI在4项实验、6923人、18978段对话中说服力稳定超过专家人类,对Save the Children的真实募款效果约为专业劝募员的近3倍。
Runway 宣布视频编辑模型 Aleph 2.0 正式登陆 Figma Weave。用户可从视频提取单帧、重绘样式后带时间戳接回 Aleph 2.0 节点,模型将编辑应用到该主体出现的每一帧并保持其余画面不变,支持最长 30 秒、1080p 的多镜头序列编辑,可换产品、改背景或整体重绘场景。
Anthropic 在 Claude Platform 发布说明中宣布,MCP tunnels(研究预览)的管理 API 从 Admin API 的 /v1/organizations/tunnels 迁移至 Claude API 的 /v1/tunnels。
Dwarkesh Patel 撰文认为,近几年 AI 进步主要来自更宽更好的数据分布和 RL 合成数据,而非样本效率提升。他估算人类从出生到成年只接触约 2 亿 token,前沿模型却训练于数十至数百万亿 token,差距近百万倍;按 Chinchilla 常数,即使无限增加参数也只能将所需数据降低约 10 倍,说明人类处于不同的 scaling 曲线。
针对华盛顿近期签署 AI 模型审查行政令、国会立法提案及限制外国公民访问 Anthropic 最先进模型等监管动向,Nathan Lambert 与 Interconnected 联合撰文警告,未来若监管甚至禁止开源 AI 将是严重错误。
Anthropic 宣布 Claude Code 支持 artifacts,可基于会话完整上下文(代码库、连接器、对话)生成 PR walkthrough、仪表盘、发布清单等实时网页,并随会话进展自动更新。页面默认组织内私有,支持版本历史和管理员权限控制,目前以 beta 形式面向 Claude Team 和 Enterprise 组织开放,可从 Claude Code CLI 和桌面应用使用。
推荐理由:官方说明给出 artifacts 的工作方式、调试场景和组织级权限设置,团队用户可据此评估是否引入协作流程。
Anthropic 的 Python、TypeScript、Go、Java、Ruby、PHP 和 C# SDK 现已支持 code_execution_20260120 代码执行工具版本,该版本新增 REPL 状态持久化,并且是程序化工具调用的最低版本要求。
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 三个地方规划部门合作,开发基于 Gemini 的规划工具原型,目标是帮规划官员将 householder 申请决策时间缩短 50%,英国计划 2027 年起向全国 council 推广。
Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转为可操作的树篱、石墙与矮林清单,覆盖英国超 13 万平方公里。
LMSYS、MOSI 与 OpenMOSS 团队宣布在 SGLang-Omni 上实现 MOSS-TTS-Local-Transformer-v1.5 的端到端服务,该开源 TTS 模型支持 48 kHz 立体声、零样本音色克隆、31 种语言和最长 10 分钟生成。
SGLang-JAX 现已支持在 TPU v7x 上高效服务 inclusionAI 的 Ling-2.6-1T,其新 Pallas kernel Fused MoE V2 将 MoE prefill 延迟从 5.16 ms 降至 2.42 ms(降幅 53%),decode kernel 延迟从 0.249 ms 降至 0.211 ms。
Sierra 于 3 月推出 Ghostwriter,让用户无需点击或写代码、只需描述需求即可构建和优化 AI 智能体。三个月后,支持主管、运营经理、QA 团队等非技术成员已能直接改进客户体验。Sierra 同时推出优化智能体的 Explorer,持续分析客户对话并找出客户流失、回答不佳和 CSAT 下滑等问题,再由 Ghostwriter 将洞察转化为改进。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,认为"对齐尚未走上正轨",计划两年内扩至 40-80 名全职员工,初期募资 1 亿至 1.5 亿美元,研究方向涵盖可扩展监督、学习理论、博弈论与 personas。
Anthropic 弃用 Claude Sonnet 4(claude-sonnet-4-20250514)和 Claude Opus 4(claude-opus-4-20250514),这两个模型在 Claude API 上的所有请求现在会返回错误。
Z Lab、SGLang 与 Modal 联合发布面向 Qwen 3.5 397B-A17B 的 DFlash 投机解码草拟模型,并随 SGLang 新的 Spec V2 引擎默认可用。
Vivid Seats 上线 AI 客服不到四周,问题解决率提升 40%、客户满意度提升 35%,CX 团队转向根因修复并将实时洞察反哺产品开发。Wilson 的 AI 智能体可追问身高与偏好来推荐具体商品,Minted 则用 AI 智能体打通各客户平台,识别趋势并分发洞察。
加州大学圣地亚哥分校在 Google 支持下,计划用 2000 台退役 Pixel 手机的主板搭建数据中心,为数百名师生提供低成本、低碳的云计算服务。该项目将手机主板组成 25-50 台的 Kubernetes 集群,SPEC 基准显示 25-50 台手机约等于一台现代服务器,20 台手机的集群已能支撑 75 人以上班级的评分负载且延迟低于 AWS 默认后端。系统预计 2026 年秋季上线。
Linear 工程师分享用 Linear Agent 自动修复进入 triage 的 bug 的经验。通过 Datadog 监控发现死 feature flag(任务形状固定,几乎每次一次修复成功)和失败的后台任务(失败率超 0.2% 时建 issue,约三分之一修复命中),并加入门控让 agent 先证明理解问题以节省 token。
Linear 发布 coding sessions、自动化 triage 和 Diffs,Linear Agent 可以从 issue 直接触达实现:阅读 issue 与讨论、调查代码库、提出方案、写代码并开 PR,全程在云端用 Claude Code 或 Codex 等模型与 harness 完成。
推荐理由:Linear 官方给出从 issue 到 PR 的完整执行闭环细节,并附自用数据与 Ramp、Coinbase 案例,读者可评估其对工程流程的影响。
Runway 与 Lionsgate 宣布扩大战略合作,Lionsgate 持有 Runway 股权,双方将启动联合开发项目制作新 IP,首个项目是基于 Lionsgate 现有 IP 与 Runway 生成模型的短剧集系列。
作者论证 AI 达到某能力阈值将引发大规模裁员的叙事不成立。纽约州 WARN 披露首年超 160 家公司提交通知,仅 Nespresso 勾选 AI 项,约 25,000 名被裁者中仅 46 人与 AI 相关;Block、Snap、Intuit 等被广泛归因于 AI 的裁员实际各有财务或重组原因,HBR 调查显示 21% 高管为预期 AI 大幅裁员、仅 2% 因实际部署裁员。
推荐理由:作者用纽约 WARN 披露、美联储研究和 GitHub 开发者数据支撑论点,给出可用于检验裁员叙事的可迁移框架。
Sierra 与 Knox Systems 合作获得 FedRAMP High 认证,可面向美国联邦机构提供 AI 智能体服务,此时距其成立仅两年多。该技术已被 40% 的 Fortune 50 企业采用,支持语音、聊天和邮件渠道及 58 种语言,全天候运行。Cigna 用其智能体在八周内投产,将患者身份验证时间缩短 80%。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于审计机器学习遗忘。