跳到正文
Hugging Face Daily Papers·· 2026-08-19AI 评分39

V-RAE:重新思考视频生成中的潜在空间

V-RAE: Rethinking Video Latent Spaces for Generation

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

V-RAE 是一种视频表示自编码器,在冻结的视觉基础模型表示之上构建紧凑的生成式潜在空间,通过轻量时序池化模块去除时序冗余并保留语义结构。它在 K600 上取得 2.13 rFVD,优于所有评测的大规模预训练视频 VAE;在 UCF101 和 K600 上 gFVD 分别为 117.86 和 19.16,收敛速度最高提升 6 倍。

来源:Hugging Face Daily Papers · arxiv.org