KATok:面向紧凑视频表示的自适应 Tokenizer
Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出 KATok,一种基于 Transformer 的 VAE,通过可学习自适应 token 选择器评估每个 token 的 keep-or-drop 概率,丢弃无信息 token,实现数据依赖的压缩。
来源:Hugging Face Daily Papers · arxiv.org