NAVA-WAM:从视频中学习原生动作先验的世界动作模型
Native Action-Prior Learning from Videos for World Action Models
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
NAVA-WAM 提出原生动作先验学习,可直接从纯观察视频预训练动作策略,无需间接的表示到控制迁移或独立的潜在动作模型。训练分两阶段:先在观察视频上通过未来视频流匹配监督优化 Action-DiT,再用带动作标注的演示进行视频-动作联合流匹配后训练,非对称注意力支持高效纯动作推理。实验显示其在分布内和分布外场景均持续优于先前方法,并展现出较强的动作标注效率和真实机器人泛化能力。
来源:Hugging Face Daily Papers · arxiv.org