跳到正文
Hugging Face Daily Papers·· 2 天前AI 评分37

Prism:面向原生 2K 音视频联合生成模型训练的动态稀疏注意力

Prism: Dynamic Sparse Attention for Native 2K Joint Video-Audio Generation Model Training

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

针对原生 2K 分辨率音视频联合生成模型训练中全注意力二次开销大、冗余 token 稀释学习信号的问题,研究者提出动态稀疏注意力框架 Prism。它将 token 序列组织为时空宏区,结合视频特征方差与音频到视频交叉注意力估计局部信息结构,为每个区动态分配块形状,并采用混合块选择策略确定逐 query 稀疏度。实验显示 Prism 相比全注意力实现 2.5 倍训练加速,且生成质量更优。

来源:Hugging Face Daily Papers · arxiv.org