World in World:用世界模型探索世界
World in World: Explore the World with World Models
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
World in World 是一种免训练的推理时接口,可将源视频观测、目标视角投影、几何渲染和检索生成状态等异构控制证据转化为带相机与时间标签的干净视觉状态,并通过冻结因果视频模型的原生自注意力读取。它借助对应路由器和 Evidence-wise attention CFG(EWA),在同一个冻结骨干上支持相机控制重渲染、长时程回访和人体动作迁移。
来源:Hugging Face Daily Papers · arxiv.org