LMSYS Blog· Intel & SGLang Team·· 2026-05-29AI 评分46
异构 CPU + GPU EPD 分离加速 VLM 服务:Dynamo 与 SGLang 实现
Heterogeneous CPU + GPU EPD Disaggregation to Boost VLM Serving
AI 导读
Dynamo 与 SGLang 通过设备感知加权路由实现异构 Encode-Prefill-Decode(EPD)分离,将 VLM 的视觉编码任务卸载到 CPU。在 Qwen3-VL-8B-Instruct 上,该方案相比纯 GPU EPD 在 QPS 1-2 负载下取得约 1.2x-1.3x 的 P99 TTFT 与请求吞吐提升,P99 TPOT 降低约 1.3x-30x。
来源:LMSYS Blog · lmsys.org