跳到正文
机器之心 · 微信公众号·· 2026-08-25AI 评分52

新加坡国立大学与牛津大学提出 V-RAE,用预训练视觉表征重构视频生成潜空间

V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

新加坡国立大学与牛津大学的研究者提出视频表征自编码器 V-RAE,以冻结的视觉基础模型作编码器,通过轻量级 temporal attention pooling 实现 4× 时间压缩,把预训练视觉表征直接用作视频生成的 latent space。

来源:机器之心 · 微信公众号 · mp.weixin.qq.com