LMSYS Blog· RadixArk SGLang Team, Ant Ling Infra Team·· 2026-08-21AI 评分52
Ling-3.0-flash 在 Blackwell 上的 batch-1 投机解码优化:单请求吞吐 2.1 倍提升
Chasing the Batch-1 Floor: Ling-3.0-flash Speculative Decode on Blackwell
AI 导读
RadixArk SGLang 团队与蚂蚁 Ling 基础设施团队将 Ling-3.0-flash 在 4 张 Blackwell GPU 上的单请求解码从 288 tok/s 提升到 606 tok/s,mean TPOT 从 3.33 ms 降到 1.53 ms。
来源:LMSYS Blog · lmsys.org