Runway 如何用 GPU 点对点广播将模型冷启动提速 60 倍
Runway 构建了 NCCLBack 系统,让新 GPU worker 直接从已加载权重的对等节点通过 GPU 互联接收权重,而非从云存储重复下载,将模型冷启动时间从数分钟缩短到数秒,冷启动时间不再随集群规模线性增长。该系统基于 NCCL broadcast 原语,配合 Redis 队列做节点发现,并包含传输与完整性校验层。
Runway 构建了 NCCLBack 系统,让新 GPU worker 直接从已加载权重的对等节点通过 GPU 互联接收权重,而非从云存储重复下载,将模型冷启动时间从数分钟缩短到数秒,冷启动时间不再随集群规模线性增长。该系统基于 NCCL broadcast 原语,配合 Redis 队列做节点发现,并包含传输与完整性校验层。
Anthropic 在 Claude 平台发布 Workload Identity Federation,可用自家身份提供方(AWS IAM、Google Cloud、GitHub Actions、Kubernetes、Microsoft Entra ID、Okta、SPIFFE 等)签发的短时 OIDC token 认证 Claude API,替代长期静态 API key。
Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。
推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。
Anthropic 已停用 Claude Sonnet 4.5 和 Claude Sonnet 4 的 1M token 上下文窗口 beta(context-1m-2025-08-07),beta header 对这两个模型不再生效,超过标准 200k token 上下文窗口的请求将返回错误。
Anthropic 发布 Claude API skill,这是一个开源 Agent Skill,为 Claude 提供构建 Messages API 和 Claude Managed Agents 的最新参考资料,覆盖 8 种语言。该 skill 随 Claude Code 捆绑提供,也可在 Anthropic skills 仓库获取。
SGLang 为 RL 工作负载引入基于 RDMA 的 P2P 权重更新机制,通过 Mooncake TransferEngine 传输,将 1T 参数 Kimi-K2 的权重传输从 53 秒缩短至 7.2 秒,提速 7 倍,代价是每个训练 rank 额外占用 32G CPU 内存的推理引擎副本。
Mistral AI 发布 Workflows 公开预览版,定位为企业 AI 的编排层,提供持久执行、可观测性和人工审批能力。开发者用 Python 编写工作流,可发布到 Le Chat 由业务人员触发,每步在 Studio 中可追踪审计。
Runway 将 Kueue 作为 Kubernetes 准入控制器管理多团队共享的 GPU 集群,在保证团队预留容量的同时把 GPU 利用率提升超过 20 个百分点。
SGLang 与 Miles 团队宣布在发布当天为 DeepSeek-V4 (1.6T Pro, 284B Flash) 提供推理与 RL 训练的开源支持,针对其混合稀疏注意力、mHC 和 FP4 专家权重架构做了专项适配。
推荐理由:原文给出 ShadowRadix、HiSparse 等具体优化机制和基准数字,读者可以了解混合稀疏注意力架构对推理与 RL 训练系统的实际工程要求。
Anthropic 为 Claude 平台推出 Rate Limits API,管理员可通过编程方式查询其组织与工作区已配置的速率限制。
DeepSeek API 已支持 V4-Pro 与 V4-Flash,兼容 OpenAI ChatCompletions 接口与 Anthropic 接口,base_url 不变,model 参数改为 deepseek-v4-pro 或 deepseek-v4-flash。
推荐理由:官方说明了新模型接入方式与旧模型名停用时间,开发者可以据此安排迁移。
Sierra 宣布收购总部位于巴黎的 Fragment,后者利用 AI 帮助企业扩展运营、让员工专注于更高价值工作。Fragment 联合创始人 Olivier Moindrot 和 Guillaume Genthial 将加入 Sierra,增强其在法国的智能体开发能力。
Google 宣布在 Google Photos 的 Auto frame 功能中推出新的拍照后视角调整方法,通过 ML 模型理解场景空间布局并用生成式 AI 从新视角重构成像。
推荐理由:原文解释了两阶段 3D 场景重建加生成补全的技术路线,读者可以了解它与传统裁剪编辑的本质差别。
Anthropic 宣布 Claude Managed Agents 的内置记忆功能今日起开放公开测试,智能体可跨会话持续学习。记忆以文件形式挂载在文件系统上,可导出、通过 API 管理,支持多智能体共享同一 store、权限分级、审计日志和版本回滚。Netflix、Rakuten、Wisedocs 等团队已在用例中称首过错误减少 97%、验证提速 30%。
推荐理由:官方公告给出记忆机制原理和企业用例数据,开发者可以据此评估是否用它替代自建记忆基础设施。
Claude Managed Agents 的记忆功能现已进入公开测试,使用标准的 managed-agents-2026-04-01 header 即可调用。完整集成指南见 Using agent memory 文档。
Sierra 取消编码和算法面试,改为 AI 原生 onsite,候选人先与面试官共同定义产品,再用 2 小时自由使用 AI 工具构建,最后演示并复盘代码与产品取舍。公司同时用系统设计面试取代编码电话筛,并试点调试面试考察 1 到 N 的改进能力;作者称新流程信号更丰富,候选人反馈更投入,但开放式设计带来标准化难题,需配套评估标准和双人面试来校准。
推荐理由:Sierra 作者亲历重构招聘流程,给出了可迁移的 AI 原生面试设计与权衡细节。
Google DeepMind 发布 Decoupled DiLoCo(分布式低通信)训练架构,将训练拆分为异步的算力孤岛,硬件故障被隔离后其余部分可继续学习。
Google Research 在 ICLR 论文中提出 Agent 记忆框架 ReasoningBank,从成功和失败经验中蒸馏可迁移的推理记忆用于测试时自进化,代码已在 GitHub 开放。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助全球企业规模化采用前沿 AI。合作方将获得包括 Gemini 系列在内的前沿模型早期访问权,并可直接对接 Google DeepMind 技术团队,聚焦金融、制造、零售、媒体娱乐等行业的智能体转型。目前仅 25% 的组织成功将 AI 规模化投入生产。
Sierra 开源 μ-Bench,包含来自 250 通真实客服电话的 4,270 条人工标注语音,覆盖英语、西班牙语、土耳其语、越南语和普通话,评测 Deepgram Nova-3、Google Chirp-3、Azure Speech、ElevenLabs Scribe v2 和 OpenAI GPT-4o Mini Transcribe。
Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的"状态-输入"梯度。该方法针对长时程规划中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维隐空间失效模式等问题,使基于梯度的长时程规划更稳健。
Anthropic 已退役 Claude Haiku 3(claude-3-haiku-20240307),所有对该模型的请求现在都会返回错误。官方建议用户升级至 Claude Haiku 4.5。
针对 AI 工具宣称能快速生成界面、把文字直接变成产品甚至代码,文章指出设计的难点从来不是生成形式,而是理解问题本身。作者引用 Christopher Alexander《Notes on the Synthesis of Form》中"形式与语境良好契合"的定义,认为 AI 能快速产出看似精致的方案,却无助于理解底层问题,反而容易让人跳过对真实约束的梳理。
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,改进可控性、表现力和质量,在 Artificial Analysis TTS 排行榜获得 1,211 Elo 分。
推荐理由:官方介绍新增 audio tags 和多说话人对话能力,还给出 AI Studio 导演式控制与 API 导出的具体用法,便于开发者评估接入。
Anthropic 发布 Claude Opus 4.7,定位复杂推理与智能体编码,定价维持 $5/$25 per MTok,与 Opus 4.6 相比存在 API 破坏性变更并需参考迁移指南。
推荐理由:原文列出定价、API 破坏性变更、task budgets 与高分辨率图像等具体变化,升级前可据此排查迁移成本。
微软发布 MAI-Image-2-Efficient 图像模型,定位量产场景,成本比旗舰低 41%,适用于产品图、营销素材、UI 原型和批量管线,支持短文本和实时交互工作流。
Anthropic 宣布弃用 Claude Sonnet 4(claude-sonnet-4-20250514)和 Claude Opus 4(claude-opus-4-20250514),Claude API 上的退役时间定于 2026 年 6 月 15 日。官方建议分别迁移至 Claude Sonnet 4.6 和 Claude Opus 4.8。
Google DeepMind 发布 Gemini Robotics-ER 1.6,提升机器人在空间推理、多视角理解、任务规划和成功检测方面的能力,并新增仪表读数功能。
推荐理由:官方给出了与上一代的具体能力对比和仪表读数新用例,读者可据此评估其是否适配现有机器人方案。
LMSYS 提出分层内存系统 HiSparse,将不活跃的 KV cache 卸载到主机内存、在 GPU HBM 保留热缓冲区,缓解稀疏注意力的显存容量瓶颈。在 GLM-5.1-FP8 上,长上下文场景吞吐最高提升 5 倍,256 并发请求时吞吐超过基线 3 倍。该功能已作为实验特性集成进 SGLang,目前支持 DeepSeek-V3.2 和 GLM-5.1 等采用 DSA 的模型。
Sierra 推出 Level 1 PCI 合规支付能力,称其为首个达到该标准的对话式 AI 平台,支持聊天和语音场景中直接完成卡片和 ACH 支付。支付时智能体切换到安全交易流程,持卡数据经专用 PCI 认证基础设施直达商户现有支付处理器,LLM 不接触敏感信息;该能力已由 Visa 全球服务提供商注册处验证,SiriusXM 等客户每日处理数千笔支付。
Sierra 发布两款自研搜索模型 Linnaeus(检索)与 Darwin(重排),用于其客服 AI 智能体,解决率最高提升 16 个百分点。Linnaeus 直接处理完整对话,recall@5 提升 20%、recall@30 约 95%,每次搜索延迟最多降低约 800ms;Darwin 负责精准筛选,使搜索成本与 P90 延迟均下降超 75%。
Google Research 提出一套基于情境判断测试(SJT)的框架,评估 LLM 在真实用户-助手场景中的行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。在人类标注完全一致的场景中,小于 120B 的模型与前沿闭源模型对齐度接近完美,但共识低于 90% 时对齐度停滞在 80% 出头。
Microsoft AI 宣布发布 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2 三款模型,现已在 Microsoft Foundry 和 MAI Playground 开放。
推荐理由:官方公布三款 MAI 模型的 Foundry 定价与基准对比,开发者可直接据此评估接入成本和可用性。
Microsoft 发布语音识别模型 MAI-Transcribe-1,定价 $0.36 每小时音频,称其在大规模云厂商中具备最优性价比。模型正在 Copilot Voice 模式和 Microsoft Teams 中分阶段部署,并已在 Microsoft Foundry 公开预览,同时可在新上线的 Microsoft AI Playground 体验。
Eric Eyken-Sluyters 加入 Sierra 担任现场运营总裁,负责全球销售、销售工程与合作伙伴团队。Sierra 上线两年已成为客户体验 AI 智能体领域的领先平台,服务 Fortune 50 中 40% 的企业,客户包括 ADT、Chime、Cigna、Nordstrom、Nubank、Rivian、Wayfair 等。Eric 拥有超过三十年构建和扩展高增长企业软件业务的经验。
Sierra 发布 Explorer,一款与建智能体的 Ghostwriter 配合、主动指出智能体需修复或改进之处的智能体优化工具,可视为针对客户对话而非互联网的 ChatGPT deep research。它持续扫描每段客户对话并每周推送变化简报,支持一键经 Ghostwriter 落地建议;ADT、DIRECTV 等数百家企业每周使用,ADT 称其让此前不可见的表现维度变得可分析。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了评测条目数与每条目标注者数的权衡,发现常用的 1–5 名标注者往往不足,可靠结果常需每条目 10 名以上标注者。
Runway 推出面向早期创业公司的 Runway Builders 计划,为 Seed 至 Series C 阶段公司提供最高 50 万免费 API credits、最高速率限制及 Runway Characters 的早期访问权限。
Runway 正式推出 Runway Fund,专注投资 AI、媒体与世界模拟领域的早期公司,初期承诺投入最高 1000 万美元,单笔投资一般不超过 50 万美元,面向 pre-seed 和种子轮。该基金已低调运作数年,此前投资了 Cartesia、LanceDB 和 Tamarind Bio,重点关注 AI 研究、新应用以及新媒体与内容三大方向。
Mistral AI 发布面向人类开发者和编码 Agent 的 CLI 工具 Spaces。核心设计包括每个交互式输入都提供等价 flag 和 -y 无头模式、生成 context. 与 AGENTS.md 供 Agent 读取项目上下文、插件化的模块注册表,并将状态显式化以避免 CWD 等隐式假设;文中 Agent 从单个提示词到完成部署耗时不到 10 分钟。