SGLang 团队探索 Agent 辅助开发:用 SKILL.md 和 SOTA 循环编码工程流程
SGLang 团队将 CUDA 崩溃调试、diffusion 模型接入、性能 profile、生产事故分诊等开发流程封装为可执行的 SKILL.md 技能,并构建基于 Humanize/RLCR 的 SOTA Performance Loop。
SGLang 团队将 CUDA 崩溃调试、diffusion 模型接入、性能 profile、生产事故分诊等开发流程封装为可执行的 SKILL.md 技能,并构建基于 Humanize/RLCR 的 SOTA Performance Loop。
Hugging Face 与 Cerebras 展示了一套全开源、模块化可替换的实时语音到语音流水线,语言模型采用 Google DeepMind 的 Gemma 4 31B,在 Cerebras 上推理,语音识别用 Nvidia Parakeet,语音合成用 Alibaba Qwen3TTS。
SGLang 为 DeepEP MoE 推理引入两种调度期负载均衡方案:面向共享专家的 Waterfill 和基于线性规划、针对冗余专家副本的 LPLB。
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小。在 Spanner 生产环境测试数月后,内存用量降低 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。
Mistral 发布 Mistral OCR 4,除提取文本外还返回边界框、块类型分类(标题、表格、公式、签名等)和逐页逐词的内联置信度分数,支持 170 种语言、10 个语言组。
推荐理由:官方说明了新模型的结构化输出能力、基准得分及其已知评分缺陷,并给出 API 与 Document AI 的选择规则,便于读者判断适用场景。
LMSYS、MOSI 与 OpenMOSS 团队宣布在 SGLang-Omni 上实现 MOSS-TTS-Local-Transformer-v1.5 的端到端服务,该开源 TTS 模型支持 48 kHz 立体声、零样本音色克隆、31 种语言和最长 10 分钟生成。
SGLang-JAX 现已支持在 TPU v7x 上高效服务 inclusionAI 的 Ling-2.6-1T,其新 Pallas kernel Fused MoE V2 将 MoE prefill 延迟从 5.16 ms 降至 2.42 ms(降幅 53%),decode kernel 延迟从 0.249 ms 降至 0.211 ms。
Anthropic 弃用 Claude Sonnet 4(claude-sonnet-4-20250514)和 Claude Opus 4(claude-opus-4-20250514),这两个模型在 Claude API 上的所有请求现在会返回错误。
Z Lab、SGLang 与 Modal 联合发布面向 Qwen 3.5 397B-A17B 的 DFlash 投机解码草拟模型,并随 SGLang 新的 Spec V2 引擎默认可用。
加州大学圣地亚哥分校在 Google 支持下,计划用 2000 台退役 Pixel 手机的主板搭建数据中心,为数百名师生提供低成本、低碳的云计算服务。该项目将手机主板组成 25-50 台的 Kubernetes 集群,SPEC 基准显示 25-50 台手机约等于一台现代服务器,20 台手机的集群已能支撑 75 人以上班级的评分负载且延迟低于 AWS 默认后端。系统预计 2026 年秋季上线。
SGLang 与 Miles 团队宣布 Day-0 支持 NVIDIA Nemotron 3 Ultra,一个面向长程自主智能体的开源推理模型,采用混合 Transformer-Mamba 架构的 Latent MoE,总参数 550B、激活 55B,上下文最长 1M token,支持 NVFP4 与 BF16 推理。
Dynamo 与 SGLang 通过设备感知加权路由实现异构 Encode-Prefill-Decode(EPD)分离,将 VLM 的视觉编码任务卸载到 CPU。在 Qwen3-VL-8B-Instruct 上,该方案相比纯 GPU EPD 在 QPS 1-2 负载下取得约 1.2x-1.3x 的 P99 TTFT 与请求吞吐提升,P99 TPOT 降低约 1.3x-30x。
Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体独自完成产品本地化,耗时不到 4 个月,而他在 Slack 参与的同类项目需 10 人团队 9 到 12 个月。他经历 IDE 智能体、云端智能体、批量调用 Claude 脚本三轮迭代,并发现技能文档过长会超出上下文窗口反而推高错误率,最终把工作重心从执行迁移转向设计反馈循环。
推荐理由:作者复盘个人用 AI 编码智能体完成本地化的完整工作流,提炼出批处理脚本、反馈循环与上下文管理等可迁移方法。
Mistral 在 AI Now Summit 2026 宣布面向工业工程的整体 AI 栈,并与 Airbus、BMW 和 ASML 合作,覆盖设计、仿真和生产场景。
AMD 与 SGLang 团队联合优化,使 MI355X 在 DeepSeek-R1 大规模分离式推理中实现 129 tok/s/user 交互性下每百万 token $0.169 的成本,比 B200 TRT-LLM 低 5%,单 GPU 吞吐比 B200 SGLang 高 1.25 倍,结果由 SemiAnalysis 的 InferenceX 持续基准验证。
Anthropic 宣布 Claude Managed Agents 支持自托管沙箱和 MCP 隧道,让智能体在企业自身边界内执行工具并访问私有网络中的 MCP 服务器。
推荐理由:原文给出自托管沙箱与 MCP 隧道的边界划分和支持的沙箱提供商,读者可据此评估企业内智能体部署路径。
Runway 工程团队通过一个三行模块的四种并行尝试,展示手工分布式训练中梯度易出静默错误的根因,并说明 PyTorch DTensor 如何用 placement 元数据自动插入正确的 collective 来保证正确性。
Runway 发布开源 Python 库 confingy 并已上架 PyPI,用于配置 ML 系统,内部已将全部 YAML 配置迁移过去。
Anthropic 推出 Claude Platform on AWS,Claude API 现可通过 AWS 原生端点访问,使用 AWS 计费和 IAM 认证。可用能力包括完整 Messages API、Files API、Message Batches API、Claude Managed Agents、Agent Skills、代码执行和工具使用。
推荐理由:官方宣布 Claude API 可经 AWS 原生端点访问,支持 IAM 认证与计费,读者可据此评估迁移或接入路径。
Runway 发布 Characters,基于 GWM-1 将单张参考图转为可实时对话的视频角色,无需微调,支持写实人像、卡通和吉祥物等风格。模型每帧有效耗时 37 毫秒,用户停止说话到角色开口的服务端延迟 1.75 秒;通过扩散变换器与 VAE 解码器流水线并行、KV-cache 管理、CUDA Graphs 和 Triton 核优化实现 24fps 实时生成。
推荐理由:官方技术博客拆解了实时管线的关键数字和系统优化,读者可以据此理解单图驱动的对话视频智能体的实现路径。
Runway 构建了 NCCLBack 系统,让新 GPU worker 直接从已加载权重的对等节点通过 GPU 互联接收权重,而非从云存储重复下载,将模型冷启动时间从数分钟缩短到数秒,冷启动时间不再随集群规模线性增长。该系统基于 NCCL broadcast 原语,配合 Redis 队列做节点发现,并包含传输与完整性校验层。
Anthropic 在 Claude 平台发布 Workload Identity Federation,可用自家身份提供方(AWS IAM、Google Cloud、GitHub Actions、Kubernetes、Microsoft Entra ID、Okta、SPIFFE 等)签发的短时 OIDC token 认证 Claude API,替代长期静态 API key。
SGLang 为 RL 工作负载引入基于 RDMA 的 P2P 权重更新机制,通过 Mooncake TransferEngine 传输,将 1T 参数 Kimi-K2 的权重传输从 53 秒缩短至 7.2 秒,提速 7 倍,代价是每个训练 rank 额外占用 32G CPU 内存的推理引擎副本。
Mistral AI 发布 Workflows 公开预览版,定位为企业 AI 的编排层,提供持久执行、可观测性和人工审批能力。开发者用 Python 编写工作流,可发布到 Le Chat 由业务人员触发,每步在 Studio 中可追踪审计。
Runway 将 Kueue 作为 Kubernetes 准入控制器管理多团队共享的 GPU 集群,在保证团队预留容量的同时把 GPU 利用率提升超过 20 个百分点。
SGLang 与 Miles 团队宣布在发布当天为 DeepSeek-V4 (1.6T Pro, 284B Flash) 提供推理与 RL 训练的开源支持,针对其混合稀疏注意力、mHC 和 FP4 专家权重架构做了专项适配。
推荐理由:原文给出 ShadowRadix、HiSparse 等具体优化机制和基准数字,读者可以了解混合稀疏注意力架构对推理与 RL 训练系统的实际工程要求。
Anthropic 宣布 Claude Managed Agents 的内置记忆功能今日起开放公开测试,智能体可跨会话持续学习。记忆以文件形式挂载在文件系统上,可导出、通过 API 管理,支持多智能体共享同一 store、权限分级、审计日志和版本回滚。Netflix、Rakuten、Wisedocs 等团队已在用例中称首过错误减少 97%、验证提速 30%。
推荐理由:官方公告给出记忆机制原理和企业用例数据,开发者可以据此评估是否用它替代自建记忆基础设施。
Google DeepMind 发布 Decoupled DiLoCo(分布式低通信)训练架构,将训练拆分为异步的算力孤岛,硬件故障被隔离后其余部分可继续学习。
LMSYS 提出分层内存系统 HiSparse,将不活跃的 KV cache 卸载到主机内存、在 GPU HBM 保留热缓冲区,缓解稀疏注意力的显存容量瓶颈。在 GLM-5.1-FP8 上,长上下文场景吞吐最高提升 5 倍,256 并发请求时吞吐超过基线 3 倍。该功能已作为实验特性集成进 SGLang,目前支持 DeepSeek-V3.2 和 GLM-5.1 等采用 DSA 的模型。
Sierra 推出 Level 1 PCI 合规支付能力,称其为首个达到该标准的对话式 AI 平台,支持聊天和语音场景中直接完成卡片和 ACH 支付。支付时智能体切换到安全交易流程,持卡数据经专用 PCI 认证基础设施直达商户现有支付处理器,LLM 不接触敏感信息;该能力已由 Visa 全球服务提供商注册处验证,SiriusXM 等客户每日处理数千笔支付。
Mistral AI 发布面向人类开发者和编码 Agent 的 CLI 工具 Spaces。核心设计包括每个交互式输入都提供等价 flag 和 -y 无头模式、生成 context. 与 AGENTS.md 供 Agent 读取项目上下文、插件化的模块注册表,并将状态显式化以避免 CWD 等隐式假设;文中 Agent 从单个提示词到完成部署耗时不到 10 分钟。
SGLang 在 NVIDIA GTC 2026 期间举办五场活动,包括黄仁勋 GTC 主题演讲的 NVIDIA AI 生态幻灯片展示、开源 AI 专题讨论、官方训练实验室,以及与 RadixArk 联合举办的 Happy Hour 和 LinkedIn 约 200 人规模的 meetup。
Mistral AI 推出 Forge,一套让企业基于自有专有知识训练前沿级 AI 模型的系统,支持预训练、后训练与强化学习全流程。Forge 同时支持 dense 与 MoE 架构,并可处理多模态输入,模型可在企业自有基础设施内训练与治理。该平台以智能体优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数并生成合成数据。
Miles 开源强化学习框架现已支持 ROCm,可在 AMD Instinct MI300/350 系列 GPU 上原生运行大规模 RL 后训练。该框架基于 SGLang 和 Slime 生态,支持 GRPO/PPO、Ray 编排及 Megatron-LM 集成,并提供预构建容器。
Google Research 宣布在 Flood Hub 上推出城市山洪预报,借助基于 Gemini 的 Groundsource 方法从新闻报告中提取历史山洪数据,用 LSTM 模型提前 24 小时预测城市山洪风险。
推荐理由:原文给出 Flash Flood 预报的技术路线和与 NWS 的对比指标,读者可以了解 AI 预警如何弥补全球南方的预警缺口。
Mistral 构建了一个自主智能体,读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行,基于开源编码助手 Vibe 搭建,通过 AGENTS.md、分类 skills 文件和 RuboCop、SimpleCov 自定义工具实现。
推荐理由:原文完整给出了用 Vibe 搭建 Rails 测试智能体的方法,AGENTS.md、skills 和自纠工具的做法可迁移复用。
SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。
推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。
SGLang 团队与 NVIDIA 合作宣布,在 SemiAnalysis InferenceXv2 基准上,SGLang 运行 DeepSeek R1 在 GB300 NVL72 上相比 H200 实现最高 25x 性能提升,同时不到 4 个月内将 GB200 NVL72 上的性能提升最高 8x。
SGLang 在 GB300 NVL72 上部署 DeepSeek R1-NVFP4,128K/8K 长上下文场景下实现 226.2 TPS/GPU,较 GB200 提升 1.53X;相同吞吐下 MTP 使用户吞吐再提升 1.87X。
SGLang-Diffusion 公布面向生产级视频生成的进阶优化,覆盖并行策略、VAE、服务稳定性与 I/O。序列并行从帧级改为 token 级分片,在 8×H100 上把填充开销从 3 帧(14.3%)降到 0,all-to-all 通信量降至 0.875×。同时为 Wan-VAE 实现按高度分片的并行编解码,并修复 Cache-DiT 在多请求服务下的缓存污染与崩溃问题。