ZimaBlue 用大规模视频预训练构建世界动作模型,零样本成功率提升至 77.8%
ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
ZimaBlue 提出从大规模视频学习可泛化世界动作模型(WAM)的三段式训练框架,先在人类与机器人第一视角视频上做因果具身视频预训练,再通过统一动作表示在异构机器人轨迹上做视频-动作中期训练,最后针对目标机器人专门化。
来源:Hugging Face Daily Papers · arxiv.org