跳到正文
Together AI Blog·· 2026-03-05AI 评分52

FlashAttention-4 发布:算法与内核协同设计针对 Blackwell 非对称硬件扩展

FlashAttention-4: Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

Together AI 团队发布 FlashAttention-4,通过算法与内核协同设计最大化 Blackwell GPU 上矩阵乘与其他资源瓶颈的重叠。在 B200 BF16 上达到最高 1605 TFLOPs/s(71% 利用率),前向比 cuDNN 9.13 快最高 1.3 倍、比 Triton 快最高 2.7 倍。

来源:Together AI Blog · together.ai