LMSYS Blog· Shangming Cai·· 2026-01-15AI 评分48
SGLang 流水线并行如何扩展至百万级 Token 上下文
Pipeline Parallelism in SGLang: Scaling to Million-Token Contexts and Beyond
AI 导读
SGLang 推出高度优化的流水线并行(PP)实现,融合分块流水线并行、异步 P2P 通信与动态分块机制,专为超长上下文推理设计。在 H20 集群上以 PP4 TP8 部署 DeepSeek-V3.1、分块预填充设为 12K 时,预填充吞吐达 TP8 的 3.31 倍,比 TP32 方案高出 30.5%,同时 TTFT 最多降低 67.9%,强扩展效率保持 82.8%。
来源:LMSYS Blog · lmsys.org