跳到正文
@akashi203 · X·· 2026-07-16AI 评分30

将 27B 三值 LLM 的整个解码步骤融合进单个 CUDA kernel

Fusing a 27B ternary LLM's whole decode step into one CUDA kernel

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

一项工作把 27B 三值 LLM 的整个解码步骤融合进单个 CUDA kernel。该方案针对三值权重模型的解码阶段做 kernel 级融合,具体加速比、硬件型号与可用性原文未给出。

来源:@akashi203 · X · x.com