跳到正文
原文
LMSYS Blog· RadixArk SGLang Team, Ant Ling Infra Team·· 2026-08-21AI 评分52

Ling-3.0-flash 在 Blackwell 上的 batch-1 投机解码优化:单请求吞吐 2.1 倍提升

Chasing the Batch-1 Floor: Ling-3.0-flash Speculative Decode on Blackwell

AI 导读

RadixArk SGLang 团队与蚂蚁 Ling 基础设施团队将 Ling-3.0-flash 在 4 张 Blackwell GPU 上的单请求解码从 288 tok/s 提升到 606 tok/s,mean TPOT 从 3.33 ms 降到 1.53 ms。

来源:LMSYS Blog · lmsys.org