跳到正文
PyTorch Blog· Sean Chen (Red Hat) and Shangdi Yu (PyTorch, Meta Platforms)·· 4 天前AI 评分40

vLLM 集成 Helion 线性后端:Hopper GPU 上部分负载吞吐提升超 10%

Building a High-Performance and Portable vLLM Linear Backend with Helion

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

vLLM 将 PyTorch 原生内核 DSL Helion 集成进线性后端,用单一 GEMM 实现覆盖 Standard GEMM、Split-K、Swap-AB 等变体,并按 shape 自动调优选择最优配置。

来源:PyTorch Blog · pytorch.org