V-CoLA:面向线性注意力的视觉 Token 压缩方法
V-CoLA: Vision Token Compression with Linear Attention
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
V-CoLA 是一个免训练的视觉 token 压缩框架,专为 Qwen3.5 等采用线性注意力的混合架构设计。它通过唯一性感知重要性准则筛选关键视觉 token,并配合自适应 token 合并策略完成压缩,仅保留 50.0% 视觉 token 即可达到原性能的 99.5%,降至 12.5% 时仍保留 88.0% 以上,同时带来 1.86× 至 6.15× 的 prefill 加速。
来源:Hugging Face Daily Papers · arxiv.org