跳到正文
Cohere 产品与研究博客·· 29 天前精选AI 评分61

Cohere 发布 North Mini Code 的 megakernel 推理引擎,端到端比 vLLM 快 1.25-1.41 倍

Inside the megakernel serving engine for North Mini Code

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

Cohere 发布围绕 decode megakernel 构建的 North Mini Code 推理引擎,BF16 单张 H100 上端到端解码吞吐比 vLLM 快 1.25×-1.41×,代码已在 GitHub 开放。

推荐理由

原文给出单 H100 上对 vLLM 的端到端加速比和完整实现细节,读者可以据此评估 megakernel 路线在真实服务中的可行性。

来源:Cohere 产品与研究博客 · cohere.com