跳到正文
原文
LMSYS Blog· WiCi AI Team, SGLang Team·· 2026-08-29精选AI 评分60

SGLang 发布 SSD Expert Pack,在消费级硬件上运行 DeepSeek-V4-Flash 和 Kimi-K3

Running DeepSeek-V4-Flash and Kimi-K3 on Consumer Hardware with SSD Expert Pack

AI 导读

SGLang 将 SSD-LLaMA 的核心思路引入 MoE 推理,把放不进 VRAM 和内存的路由专家权重放在 NVMe SSD 上,通过 Expert Pack 连续布局、O_DIRECT 直接 I/O、pinned 暂存和 GPU 缓存,只加载 router 选中的专家。

推荐理由

原文给出完整机制说明和单卡实测数据,读者可以据此评估 NVMe SSD 承载超大 MoE 模型的可行性。

来源:LMSYS Blog · lmsys.org