MovieGrid 用多网格后训练生成多镜头长视频,镜头数提升 6.05 倍
Multi-Grid Post-Training for Long-Form Multi-Shot Video Generation
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
论文提出 MovieGrid 多网格后训练范式,将长视频分解为按时间排序的短片并排布在空间网格上联合建模,从而减少每条时间轴要处理的镜头数量。作者基于 1,000 个长视频构建 MGLV 数据集,产出 54K 网格视频及带角色标注的故事提示词。
来源:Hugging Face Daily Papers · arxiv.org