跳到正文
@cohere· @cohere · X·· 28 天前AI 评分39
AI 导读

一个 megakernel 将整个 LLM 解码步骤融合进单次 kernel 启动。我们在此基础上,通过 kernel 融合最大化 GPU 利用率,同时支持真实服务器所需的一切。 在 GitHub 上查看我们是如何实现的:https://t.co/f0P7dkv89S

正文

A megakernel fuses the entire LLM decode step into a single kernel launch. We build on this by maximizing GPU utilization through kernel fusion while supporting everything a real server needs.

Check out how we got there on GitHub: https://t.co/f0P7dkv89S

来源:@cohere · x.com