腾讯混元提出 Stem 稀疏注意力算法,128K 上下文首字延迟降低 3.6 倍
腾讯混元提出 Stem 稀疏注意力算法,首字延迟降低 3.6 倍
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
腾讯混元提出 Stem 稀疏注意力算法,已被 ICML-26 收录,仅用 25% 算力即可逼近稠密注意力精度。该算法通过 Token 位置衰减(TPD)和输出感知度量(OAM)实现近无损精度,配套 HPC 开源的 Stem+BSA 算子将稀疏收益转化为真实硬件加速,在 128K 上下文下首字延迟降低 3.6 倍。
来源:IT Home · ithome.com