跳到正文
Hugging Face Daily Papers·· 6 天前AI 评分36

SemanTok:面向高效自回归视频生成的可预测语义 token

SemanTok: Predictable Semantic Tokens for Efficient Autoregressive Video Generation

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

SemanTok 是一种灵活视频 tokenizer,将冻结的 DINO 特征输入编码器,并用轻量 head 从每个保留的 token 前缀单独重建这些特征。201M 的 SemanTok AR 模型在保真度上追平或超过 3.4 倍规模的 VideoFlexTok AR 模型,更大模型还能进一步提升保真度。它在分布外类别上保持语义对齐,并在包括纯噪声在内的每个噪声水平上为解码器提供更高的语义对齐。

来源:Hugging Face Daily Papers · arxiv.org