Cohere 发布 North Mini Code 的 megakernel 推理引擎,端到端比 vLLM 快 1.25-1.41 倍
Inside the megakernel serving engine for North Mini Code
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Cohere 发布围绕 decode megakernel 构建的 North Mini Code 推理引擎,BF16 单张 H100 上端到端解码吞吐比 vLLM 快 1.25×-1.41×,代码已在 GitHub 开放。
推荐理由
原文给出单 H100 上对 vLLM 的端到端加速比和完整实现细节,读者可以据此评估 megakernel 路线在真实服务中的可行性。
来源:Cohere 产品与研究博客 · cohere.com