新加坡国立大学与牛津大学提出 V-RAE,用预训练视觉表征重构视频生成潜空间
V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
新加坡国立大学与牛津大学的研究者提出视频表征自编码器 V-RAE,以冻结的视觉基础模型作编码器,通过轻量级 temporal attention pooling 实现 4× 时间压缩,把预训练视觉表征直接用作视频生成的 latent space。
来源:机器之心 · 微信公众号 · mp.weixin.qq.com