百万上下文下的 DeepSeek V4:SGLang 推理优化实战
百万上下文下的 DeepSeek V4:SGLang 推理优化实战|AICon 深圳
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
SGLang 团队针对 DeepSeek V4 的混合注意力架构(SWA、CSA、HCA)实现百万上下文推理的 Day-0 支持,通过 ShadowRadix 统一管理三套 KV Cache,并用 FlashCompressor、Lightning TopK 等算子优化。
来源:InfoQ · 微信公众号 · mp.weixin.qq.com