SGLang 如何用 Score API 与共享上下文扩展类 JEV 决策模型
SGLang 的 /v1/score 接口让调用方通过 label_token_ids 显式声明所需标签分数,避免依赖生成响应 top-k logprobs 中是否出现该标签。
lmsys.org · 网站与博客
SGLang 的 /v1/score 接口让调用方通过 label_token_ids 显式声明所需标签分数,避免依赖生成响应 top-k logprobs 中是否出现该标签。
NVIDIA 与 SGLang 合作实现 NVFP4 KV cache,在 Blackwell 上以 4 比特存储 K/V,配合 FP8 分块缩放与 FP32 张量级缩放两级量化,打包数据加块缩放仅占 FP8 约 56% 存储。
SGLang 与 Miles 团队宣布为 DeepSeek-V4.1 提供 Day-0 支持,讲解其 SWA、mHC、Engram 记忆等架构及推理与 RL 训练优化。
推荐理由:原文详解 SGLang 与 Miles 对 DeepSeek-V4.1 的 Day-0 支持,给出 Engram offload、bounded replay 等实测数字和可复现配置。
SGLang 将 SSD-LLaMA 的核心思路引入 MoE 推理,把放不进 VRAM 和内存的路由专家权重放在 NVMe SSD 上,通过 Expert Pack 连续布局、O_DIRECT 直接 I/O、pinned 暂存和 GPU 缓存,只加载 router 选中的专家。
推荐理由:原文给出完整机制说明和单卡实测数据,读者可以据此评估 NVMe SSD 承载超大 MoE 模型的可行性。
LMSYS 团队发布 Infer-forge,一套围绕 SGLang 独立构建、未开源的推理工程系统,公开其 Harness、Loop、Graph 三层方法论,供团队用 AI 编码工具自行搭建。
SGLang Diffusion 在 8×NVIDIA H200 上对 MiniMax-H3 视频生成完成基准测试:稠密无损路径比 Diffusers 快 1.85–1.95×,叠加 Cache-DiT 步复用与 SubBlock 稀疏注意力后最高达 6.24×,平均 SSIM 0.76–0.91。
SGLang 团队与 Qwen、NVIDIA、AMD 合作,为 Qwen 团队开源的多模态 MoE 模型 Qwen3.8-Flash-Next 提供 day-0 支持。
推荐理由:原文详解了 SGLang 对 Qwen3.8-Flash-Next 的 day-0 支持与架构实现细节,含量化检查点和实测吞吐数据,对部署选型有参考价值。
RadixArk SGLang 团队与蚂蚁 Ling 基础设施团队将 Ling-3.0-flash 在 4 张 Blackwell GPU 上的单请求解码从 288 tok/s 提升到 606 tok/s,mean TPOT 从 3.33 ms 降到 1.53 ms。
SGLang 团队联合蚂蚁 Ling Infra 团队发布 Weight Cache Daemon,通过常驻 GPU 进程和 CUDA IPC 零拷贝映射缓存量化后权重,使 Ling-2.6-1T FP8 的权重加载从约 495 秒降至 0.63 秒,端到端启动时间从 8.8 分钟降至 0.528 分钟。
Miles 是结合 SGLang 做 rollout 生成、Megatron-LM 做训练的高性能强化学习框架,其 disaggregated 架构下 rollout 数据需从推理侧传到训练侧。
LMSYS 针对 1.6 万亿参数 MoE 模型 DeepSeek-V4-Pro,在无原生 FP4 支持的 H20 GPU 上给出场景化服务方案。
LMSYS 与生态伙伴发布 Miles v0.1,一个基于 slime 设计的全栈生产级后训练系统,目标是让前沿规模 RL 训练更易用。
推荐理由:官方完整走读 Miles 的 RL 训练环路与关键数字,读者可据此评估它是否适合承担自己的前沿规模后训练任务。
SGLang 重构 CUDA Graph 支持,围绕统一的 runner/backend 接口让不同捕获策略可跨执行路径复用,并推出其原创的 Breakable CUDA Graph(BCG)服务技术。
SGLang 与 Miles 宣布 Day-0 支持 Qwen3.8-2.4T-A95B,这是千问最大的开源模型,总参数 2.4T、每 token 激活 95B,采用 69 层 GDN 线性注意力与 23 层 GQA 全注意力 3:1 交错的混合架构,MoE 含 512 专家 top-10 路由。
推荐理由:SGLang 团队详解 Qwen3.8 混合注意力架构的推理支持方案,给出内核优化、并行布局与实测吞吐数字,可作部署参考。
NVIDIA 发布 Nemotron 3.5 Lightning,一个从 Nemotron 3 Ultra 蒸馏的 30B 参数混合 MoE 开源模型,每 token 仅激活 3B,支持最长 1M token 上下文,SGLang 同步提供 Day-0 服务支持。
SGLang 发布 Unified Radix Cache,用单一 token 键控的 radix 拓扑统一混合模型前缀缓存,FULL、SWA、MAMBA 组件在同一棵树上各自执行路径、滑动窗口和 checkpoint 复用语义,HiCache 原生支持 GPU L1、Host L2 与外部 L3 层级。
SGLang 与 Meta Superintelligence Labs 合作,为 Muse Glimmer 提供 Day-0 支持。Muse Glimmer 是 30B 参数多模态稠密模型,拥有 128k+ token 上下文窗口,架构含 27.9B 文本解码器、1.9B ViT 和多模态 projector。
推荐理由:原文给出多平台实测吞吐与量化方案,读者可据此评估在本地硬件跑智能体工作流的可行性。
腾讯混元开源的 LLM 推理算子库 HPC-Ops 已将 Attention、Router GEMM 和 MoE 三类核心算子合入 SGLang 主线,面向 NVIDIA Hopper(SM90)GPU。
SGL-Diffusion 团队通过三个递进 PR 优化 AR+DiT 混合生成管线:用 SRT 替换 HF 后端将 AR 阶段解耦为独立服务,单卡 AR 耗时从 122.8s 降至 46.6s(−62.1%),4-NPU 异构配置(AR 用 TP=4、DiT 用 SP=4)下端到端延迟从 154.6s 降至 35.2s(−77.2%)。
SpecForge v0.3.0 将目标模型推理与草稿模型训练解耦,在线训练完全分离,在 8xH20 测试平台上以 3 台 SGLang 服务器加 5 个训练 worker 的拓扑,端到端训练吞吐较此前同置实现提升约 10%。
RadixArk 与 Google Cloud 合作,把开源推理框架 SGLang 带到 TPU。SGL-JAX 现已可用,支持 Gemma、Qwen、DeepSeek。
Miles 为 MoE 专家实现了两种 Blackwell 原生 RL 方案:端到端 MXFP8 与逐 token NVFP4,覆盖 rollout、前向传播、权重梯度与数据梯度 GEMM,并支持检查点转换、Megatron 训练、SGLang rollout 与在线权重更新的细粒度精度控制。
SGLang 在 issue #15194 中提出量化栈重构方案,将原本由单一类承担的量化路径拆分为 Quant Config、Linear/MoE Method、Scheme、Kernel 四层,使 checkpoint 格式解析与硬件后端执行解耦。
SGLang 和 Miles 发布对 Kimi K3 的 Day-0 支持,分别覆盖推理与 RL 训练。K3 为 2.8T 参数的 3 万亿参数级首个开源模型,采用 69 层 KDA 线性注意力与 24 层 MLA 的混合架构和 1M token 上下文窗口。
推荐理由:原文由 SGLang 团队自述 Day-0 支持的实现细节,给出内存管理、投机解码与并行策略的具体方案和实测数字,可迁移到异构注意力架构的部署。
Miles 将 On-Policy Distillation(OPD)集成进 rollout 与训练流程,支持纯蒸馏和结合 GRPO/PPO 的 RL 增强蒸馏两种模式,并通过稀疏 student-to-teacher 打分避免 O(R²K) 的密集 payload。
SGLang 与 Miles 团队同 Thinking Machines Lab 合作,为 975B 参数、上下文最长 1M tokens 的多模态模型 Inkling 提供 Day-0 支持。
推荐理由:原文给出 Inkling 架构细节、SGLang 各项优化后的具体吞吐数字,以及 Miles 侧完整 RL 训练方案,工程参考价值具体。
SGLang 在 8xB300(bs=1)上为 GLM-5.2 NVFP4 智能体负载实现超 500 TPS,两周内完成从 day-0 支持到 v0.5.15.post1 的优化。
DeepSeek-V4 Flash 的 RL 训练现已在 AMD Instinct MI355X GPU 上通过 Miles 支持,基于 ROCm 完成四节点端到端验证。
Netpreme X-Mem™ MPU 作为专用 KV 内存层接入 SGLang HiCache,在前缀密集型负载下将首 token 延迟(TTFT)较基于 Host DRAM 的方案降低 6.7 倍。
SGLang 现已支持 DSpark 投机解码,在 dense 和 sparse 模型(如 Qwen3、DeepSeek-V4)上均可用。DSpark 采用半自回归块草稿器与基于草稿模型置信度的逐请求变长验证,减少无效 token 验证。在 H200 上以 DeepSeek-V4-Flash 测试,其吞吐/延迟权衡在整个并发扫描中优于 MTP 和非投机基线。
SGLang 团队将 CUDA 崩溃调试、diffusion 模型接入、性能 profile、生产事故分诊等开发流程封装为可执行的 SKILL.md 技能,并构建基于 Humanize/RLCR 的 SOTA Performance Loop。
SGLang 为 DeepEP MoE 推理引入两种调度期负载均衡方案:面向共享专家的 Waterfill 和基于线性规划、针对冗余专家副本的 LPLB。
LMSYS、MOSI 与 OpenMOSS 团队宣布在 SGLang-Omni 上实现 MOSS-TTS-Local-Transformer-v1.5 的端到端服务,该开源 TTS 模型支持 48 kHz 立体声、零样本音色克隆、31 种语言和最长 10 分钟生成。
SGLang-JAX 现已支持在 TPU v7x 上高效服务 inclusionAI 的 Ling-2.6-1T,其新 Pallas kernel Fused MoE V2 将 MoE prefill 延迟从 5.16 ms 降至 2.42 ms(降幅 53%),decode kernel 延迟从 0.249 ms 降至 0.211 ms。
Z Lab、SGLang 与 Modal 联合发布面向 Qwen 3.5 397B-A17B 的 DFlash 投机解码草拟模型,并随 SGLang 新的 Spec V2 引擎默认可用。
LMSYS 宣布 2026 博士奖学金首位获得者为 Will Lin,奖金最高 5 万美元,用于支持其学费与杂费。Will Lin 是 UC San Diego 六年级博士生,主导开源扩散生成加速框架 FastVideo,该项目已获 3.7k+ GitHub stars,并被集成进 NVIDIA Dynamo 作为后端。
Miles 团队提出 Token-In-Token-Out(TITO)原则,要求第 n 轮 prompt 的 token 序列必须与第 n-1 轮 prompt+response 逐位一致,以消除智能体 RL 中训练与推理的 token 序列不匹配。
Boson AI 与 SGLang-Omni 团队宣布在 SGLang-Omni 上提供 Higgs Audio v3 TTS 的端到端服务。模型约 4B 参数,基于 Qwen3-4B,支持流式合成和 100 种语言的个位数 WER/CER,零样本克隆在 Seed-TTS 上 WER/CER 为 1.11%。
推荐理由:原文给出多级推理架构、控制标签目录和基准延迟数据,开发者可据此评估把 TTS 接入语音 Agent 的可行性。
SGLang 与 Miles 团队宣布 Day-0 支持 NVIDIA Nemotron 3 Ultra,一个面向长程自主智能体的开源推理模型,采用混合 Transformer-Mamba 架构的 Latent MoE,总参数 550B、激活 55B,上下文最长 1M token,支持 NVFP4 与 BF16 推理。
Dynamo 与 SGLang 通过设备感知加权路由实现异构 Encode-Prefill-Decode(EPD)分离,将 VLM 的视觉编码任务卸载到 CPU。在 Qwen3-VL-8B-Instruct 上,该方案相比纯 GPU EPD 在 QPS 1-2 负载下取得约 1.2x-1.3x 的 P99 TTFT 与请求吞吐提升,P99 TPOT 降低约 1.3x-30x。