SGLang 服务 GLM-5.2 NVFP4 智能体负载:两周内达到 500 TPS
SGLang 在 8xB300(bs=1)上为 GLM-5.2 NVFP4 智能体负载实现超 500 TPS,两周内完成从 day-0 支持到 v0.5.15.post1 的优化。
SGLang 在 8xB300(bs=1)上为 GLM-5.2 NVFP4 智能体负载实现超 500 TPS,两周内完成从 day-0 支持到 v0.5.15.post1 的优化。
Runway 开源 AVTensor,一个直接调用 FFmpeg C API 的 Rust 媒体解码器,单次 demux 同时解码音频与视频并共享时间原点,解决了 torchcodec 与 torchaudio 在负 PTS 资产上时间零点不一致导致的音画失步问题。
Hugging Face 博客发布 Profiling in PyTorch 系列第三篇,在 NVIDIA A100 上用 profiler 对比手写 attention 与 SDPA 的 math、efficient、flash、cuDNN 后端。
Sierra 于今年 1 月成立六人 AI 加速团队,将多个角色专属 Agent 合并为统一 Agent Pinecone,内置在 Claude Code 和 Codex 之上。
推荐理由:原文给出 Sierra 内部推行统一 Agent 的具体做法与教训,单 Agent 架构、持久化上下文和以产出物衡量价值等经验可迁移到其他公司。
DeepSeek-V4 Flash 的 RL 训练现已在 AMD Instinct MI355X GPU 上通过 Miles 支持,基于 ROCm 完成四节点端到端验证。
Netpreme X-Mem™ MPU 作为专用 KV 内存层接入 SGLang HiCache,在前缀密集型负载下将首 token 延迟(TTFT)较基于 Host DRAM 的方案降低 6.7 倍。
Hugging Face 官方博客总结 🤗 Kernels 项目数月来的重大更新,包括 Hub 新增 kernel 仓库类型、默认仅加载受信任发布者的 kernel、基于 Sigstore cosign 的代码签名、重构 kernels 与 kernel-builder 的 CLI。
SGLang 现已支持 DSpark 投机解码,在 dense 和 sparse 模型(如 Qwen3、DeepSeek-V4)上均可用。DSpark 采用半自回归块草稿器与基于草稿模型置信度的逐请求变长验证,减少无效 token 验证。在 H200 上以 DeepSeek-V4-Flash 测试,其吞吐/延迟权衡在整个并发扫描中优于 MTP 和非投机基线。
Runway 构建了名为 deckard 的容量控制器,在生产与研究集群间重新分配 GPU:白天跟随推理需求扩缩,夜间把闲置算力借给研究,并在早高峰前归还。该控制器按五个时间窗口执行预计算调度,将工作日 8:30–12:30 ET 划为高峰子窗口,并基于排队论按 p98 延迟目标确定 GPU 数量。由于跨集群迁移节点需 20 到 60 分钟,控制器会提前预测需求波峰并预先移动容量。
SGLang 团队将 CUDA 崩溃调试、diffusion 模型接入、性能 profile、生产事故分诊等开发流程封装为可执行的 SKILL.md 技能,并构建基于 Humanize/RLCR 的 SOTA Performance Loop。
Hugging Face 与 Cerebras 展示了一套全开源、模块化可替换的实时语音到语音流水线,语言模型采用 Google DeepMind 的 Gemma 4 31B,在 Cerebras 上推理,语音识别用 Nvidia Parakeet,语音合成用 Alibaba Qwen3TTS。
SGLang 为 DeepEP MoE 推理引入两种调度期负载均衡方案:面向共享专家的 Waterfill 和基于线性规划、针对冗余专家副本的 LPLB。
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小。在 Spanner 生产环境测试数月后,内存用量降低 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。
Mistral 发布 Mistral OCR 4,除提取文本外还返回边界框、块类型分类(标题、表格、公式、签名等)和逐页逐词的内联置信度分数,支持 170 种语言、10 个语言组。
推荐理由:官方说明了新模型的结构化输出能力、基准得分及其已知评分缺陷,并给出 API 与 Document AI 的选择规则,便于读者判断适用场景。
LMSYS、MOSI 与 OpenMOSS 团队宣布在 SGLang-Omni 上实现 MOSS-TTS-Local-Transformer-v1.5 的端到端服务,该开源 TTS 模型支持 48 kHz 立体声、零样本音色克隆、31 种语言和最长 10 分钟生成。
SGLang-JAX 现已支持在 TPU v7x 上高效服务 inclusionAI 的 Ling-2.6-1T,其新 Pallas kernel Fused MoE V2 将 MoE prefill 延迟从 5.16 ms 降至 2.42 ms(降幅 53%),decode kernel 延迟从 0.249 ms 降至 0.211 ms。
Anthropic 弃用 Claude Sonnet 4(claude-sonnet-4-20250514)和 Claude Opus 4(claude-opus-4-20250514),这两个模型在 Claude API 上的所有请求现在会返回错误。
Z Lab、SGLang 与 Modal 联合发布面向 Qwen 3.5 397B-A17B 的 DFlash 投机解码草拟模型,并随 SGLang 新的 Spec V2 引擎默认可用。
加州大学圣地亚哥分校在 Google 支持下,计划用 2000 台退役 Pixel 手机的主板搭建数据中心,为数百名师生提供低成本、低碳的云计算服务。该项目将手机主板组成 25-50 台的 Kubernetes 集群,SPEC 基准显示 25-50 台手机约等于一台现代服务器,20 台手机的集群已能支撑 75 人以上班级的评分负载且延迟低于 AWS 默认后端。系统预计 2026 年秋季上线。
SGLang 与 Miles 团队宣布 Day-0 支持 NVIDIA Nemotron 3 Ultra,一个面向长程自主智能体的开源推理模型,采用混合 Transformer-Mamba 架构的 Latent MoE,总参数 550B、激活 55B,上下文最长 1M token,支持 NVFP4 与 BF16 推理。
Dynamo 与 SGLang 通过设备感知加权路由实现异构 Encode-Prefill-Decode(EPD)分离,将 VLM 的视觉编码任务卸载到 CPU。在 Qwen3-VL-8B-Instruct 上,该方案相比纯 GPU EPD 在 QPS 1-2 负载下取得约 1.2x-1.3x 的 P99 TTFT 与请求吞吐提升,P99 TPOT 降低约 1.3x-30x。
Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体独自完成产品本地化,耗时不到 4 个月,而他在 Slack 参与的同类项目需 10 人团队 9 到 12 个月。他经历 IDE 智能体、云端智能体、批量调用 Claude 脚本三轮迭代,并发现技能文档过长会超出上下文窗口反而推高错误率,最终把工作重心从执行迁移转向设计反馈循环。
推荐理由:作者复盘个人用 AI 编码智能体完成本地化的完整工作流,提炼出批处理脚本、反馈循环与上下文管理等可迁移方法。
Mistral 在 AI Now Summit 2026 宣布面向工业工程的整体 AI 栈,并与 Airbus、BMW 和 ASML 合作,覆盖设计、仿真和生产场景。
AMD 与 SGLang 团队联合优化,使 MI355X 在 DeepSeek-R1 大规模分离式推理中实现 129 tok/s/user 交互性下每百万 token $0.169 的成本,比 B200 TRT-LLM 低 5%,单 GPU 吞吐比 B200 SGLang 高 1.25 倍,结果由 SemiAnalysis 的 InferenceX 持续基准验证。
Anthropic 宣布 Claude Managed Agents 支持自托管沙箱和 MCP 隧道,让智能体在企业自身边界内执行工具并访问私有网络中的 MCP 服务器。
推荐理由:原文给出自托管沙箱与 MCP 隧道的边界划分和支持的沙箱提供商,读者可据此评估企业内智能体部署路径。
Runway 工程团队通过一个三行模块的四种并行尝试,展示手工分布式训练中梯度易出静默错误的根因,并说明 PyTorch DTensor 如何用 placement 元数据自动插入正确的 collective 来保证正确性。
Runway 发布开源 Python 库 confingy 并已上架 PyPI,用于配置 ML 系统,内部已将全部 YAML 配置迁移过去。
Anthropic 推出 Claude Platform on AWS,Claude API 现可通过 AWS 原生端点访问,使用 AWS 计费和 IAM 认证。可用能力包括完整 Messages API、Files API、Message Batches API、Claude Managed Agents、Agent Skills、代码执行和工具使用。
推荐理由:官方宣布 Claude API 可经 AWS 原生端点访问,支持 IAM 认证与计费,读者可据此评估迁移或接入路径。
Runway 发布 Characters,基于 GWM-1 将单张参考图转为可实时对话的视频角色,无需微调,支持写实人像、卡通和吉祥物等风格。模型每帧有效耗时 37 毫秒,用户停止说话到角色开口的服务端延迟 1.75 秒;通过扩散变换器与 VAE 解码器流水线并行、KV-cache 管理、CUDA Graphs 和 Triton 核优化实现 24fps 实时生成。
推荐理由:官方技术博客拆解了实时管线的关键数字和系统优化,读者可以据此理解单图驱动的对话视频智能体的实现路径。
Runway 构建了 NCCLBack 系统,让新 GPU worker 直接从已加载权重的对等节点通过 GPU 互联接收权重,而非从云存储重复下载,将模型冷启动时间从数分钟缩短到数秒,冷启动时间不再随集群规模线性增长。该系统基于 NCCL broadcast 原语,配合 Redis 队列做节点发现,并包含传输与完整性校验层。
Anthropic 在 Claude 平台发布 Workload Identity Federation,可用自家身份提供方(AWS IAM、Google Cloud、GitHub Actions、Kubernetes、Microsoft Entra ID、Okta、SPIFFE 等)签发的短时 OIDC token 认证 Claude API,替代长期静态 API key。
SGLang 为 RL 工作负载引入基于 RDMA 的 P2P 权重更新机制,通过 Mooncake TransferEngine 传输,将 1T 参数 Kimi-K2 的权重传输从 53 秒缩短至 7.2 秒,提速 7 倍,代价是每个训练 rank 额外占用 32G CPU 内存的推理引擎副本。
Mistral AI 发布 Workflows 公开预览版,定位为企业 AI 的编排层,提供持久执行、可观测性和人工审批能力。开发者用 Python 编写工作流,可发布到 Le Chat 由业务人员触发,每步在 Studio 中可追踪审计。
Runway 将 Kueue 作为 Kubernetes 准入控制器管理多团队共享的 GPU 集群,在保证团队预留容量的同时把 GPU 利用率提升超过 20 个百分点。
SGLang 与 Miles 团队宣布在发布当天为 DeepSeek-V4 (1.6T Pro, 284B Flash) 提供推理与 RL 训练的开源支持,针对其混合稀疏注意力、mHC 和 FP4 专家权重架构做了专项适配。
推荐理由:原文给出 ShadowRadix、HiSparse 等具体优化机制和基准数字,读者可以了解混合稀疏注意力架构对推理与 RL 训练系统的实际工程要求。
Anthropic 宣布 Claude Managed Agents 的内置记忆功能今日起开放公开测试,智能体可跨会话持续学习。记忆以文件形式挂载在文件系统上,可导出、通过 API 管理,支持多智能体共享同一 store、权限分级、审计日志和版本回滚。Netflix、Rakuten、Wisedocs 等团队已在用例中称首过错误减少 97%、验证提速 30%。
推荐理由:官方公告给出记忆机制原理和企业用例数据,开发者可以据此评估是否用它替代自建记忆基础设施。
Google DeepMind 发布 Decoupled DiLoCo(分布式低通信)训练架构,将训练拆分为异步的算力孤岛,硬件故障被隔离后其余部分可继续学习。
LMSYS 提出分层内存系统 HiSparse,将不活跃的 KV cache 卸载到主机内存、在 GPU HBM 保留热缓冲区,缓解稀疏注意力的显存容量瓶颈。在 GLM-5.1-FP8 上,长上下文场景吞吐最高提升 5 倍,256 并发请求时吞吐超过基线 3 倍。该功能已作为实验特性集成进 SGLang,目前支持 DeepSeek-V3.2 和 GLM-5.1 等采用 DSA 的模型。
Sierra 推出 Level 1 PCI 合规支付能力,称其为首个达到该标准的对话式 AI 平台,支持聊天和语音场景中直接完成卡片和 ACH 支付。支付时智能体切换到安全交易流程,持卡数据经专用 PCI 认证基础设施直达商户现有支付处理器,LLM 不接触敏感信息;该能力已由 Visa 全球服务提供商注册处验证,SiriusXM 等客户每日处理数千笔支付。