跳到正文
原文
LMSYS Blog· SGLang, Qwen, and NVIDIA teams·· 17 天前AI 评分46

SGLang 用 NVFP4 KV Cache 加速长上下文与智能体推理

Accelerating Long-Context and Agentic Inference with NVFP4 KV Cache

AI 导读

NVIDIA 与 SGLang 合作实现 NVFP4 KV cache,在 Blackwell 上以 4 比特存储 K/V,配合 FP8 分块缩放与 FP32 张量级缩放两级量化,打包数据加块缩放仅占 FP8 约 56% 存储。

来源:LMSYS Blog · lmsys.org