LMSYS Blog· Zhiqiang Xie, Zhangheng Huang, Tingwei Huang·· 2026-04-10AI 评分43
HiSparse:用分层内存为稀疏注意力提速,长上下文吞吐最高提升 5 倍
HiSparse: Turbocharging Sparse Attention with Hierarchical Memory
AI 导读
LMSYS 提出分层内存系统 HiSparse,将不活跃的 KV cache 卸载到主机内存、在 GPU HBM 保留热缓冲区,缓解稀疏注意力的显存容量瓶颈。在 GLM-5.1-FP8 上,长上下文场景吞吐最高提升 5 倍,256 并发请求时吞吐超过基线 3 倍。该功能已作为实验特性集成进 SGLang,目前支持 DeepSeek-V3.2 和 GLM-5.1 等采用 DSA 的模型。
来源:LMSYS Blog · lmsys.org