vLLM 集成 Helion 线性后端:Hopper GPU 上部分负载吞吐提升超 10%
Building a High-Performance and Portable vLLM Linear Backend with Helion
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
vLLM 将 PyTorch 原生内核 DSL Helion 集成进线性后端,用单一 GEMM 实现覆盖 Standard GEMM、Split-K、Swap-AB 等变体,并按 shape 自动调优选择最优配置。
来源:PyTorch Blog · pytorch.org