LMSYS Blog· Prayer, JamesBrianD, Haolin Fu, Haoguang Cai, Qinghan Chen·· 2026-06-17AI 评分40
SGLang-JAX 用单个 Pallas Kernel 优化 Ling-2.6-1T 的 TPU 推理
Optimizing Ling-2.6-1T on TPU with SGLang-JAX: Hiding MoE Data Movement Behind Compute with One Pallas Kernel
AI 导读
SGLang-JAX 现已支持在 TPU v7x 上高效服务 inclusionAI 的 Ling-2.6-1T,其新 Pallas kernel Fused MoE V2 将 MoE prefill 延迟从 5.16 ms 降至 2.42 ms(降幅 53%),decode kernel 延迟从 0.249 ms 降至 0.211 ms。
来源:LMSYS Blog · lmsys.org