FrameMorrow:用前瞻 token 做未来引导的帧选择,实现长时程视频生成
FrameMorrow: Future-guided Frame Selection with Prospective Tokens for Long-Horizon Video Generation
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
FrameMorrow 提出一种前瞻式帧选择器,先预测一小组代表未来信息需求的前瞻 token,再用它们从历史中挑选相关帧,而非依据当前内容判断历史相关性。该方法选择显式历史帧而非模型内部状态,可即插即用地接入包括闭源模型在内的多种生成器,额外推理成本很低。团队在 5 个基准、11 个生成模型上评测,覆盖长视频生成、交互式生成与动作条件世界模型,长程一致性、视觉质量和动作对齐均有稳定提升。
来源:Hugging Face Daily Papers · arxiv.org