V-RAE:重新思考视频生成中的潜在空间
V-RAE: Rethinking Video Latent Spaces for Generation
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
V-RAE 是一种视频表示自编码器,在冻结的视觉基础模型表示之上构建紧凑的生成式潜在空间,通过轻量时序池化模块去除时序冗余并保留语义结构。它在 K600 上取得 2.13 rFVD,优于所有评测的大规模预训练视频 VAE;在 UCF101 和 K600 上 gFVD 分别为 117.86 和 19.16,收敛速度最高提升 6 倍。
来源:Hugging Face Daily Papers · arxiv.org