Mistral AI·· 2026-01-22AI 评分56
Mistral AI 深入排查 vLLM 内存泄漏,定位到 UCX 的 mmap 钩子机制
Heaps do lie: debugging a memory leak in vLLM.
AI 导读
Mistral AI 团队在预生产测试中发现,使用 vLLM 部署 Mistral Medium 3.1 并开启 graph compilation 的 Prefill/Decode 分离式推理下,系统内存以每分钟 400 MB 的速度线性增长,最终导致 out of memory。
来源:Mistral AI · mistral.ai