FlashAttention-4 发布:算法与内核协同设计针对 Blackwell 非对称硬件扩展
FlashAttention-4: Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Together AI 团队发布 FlashAttention-4,通过算法与内核协同设计最大化 Blackwell GPU 上矩阵乘与其他资源瓶颈的重叠。在 B200 BF16 上达到最高 1605 TFLOPs/s(71% 利用率),前向比 cuDNN 9.13 快最高 1.3 倍、比 Triton 快最高 2.7 倍。
来源:Together AI Blog · together.ai