微软亚洲研究院与清华提出 VITRA,用纯人类视频预训练 VLA 实现灵巧操作
首次!纯人类视频预训练VLA灵巧操作,少量数据微调就能部署成功
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
微软亚洲研究院与清华大学提出 VITRA 预训练框架,将海量无标注真实人类活动视频自动转化为与机器人 V-L-A 训练格式对齐的数据,构建了包含 100 万个片段、2600 万帧的手部 V-L-A 数据集。
来源:量子位 · 微信公众号 · mp.weixin.qq.com
首次!纯人类视频预训练VLA灵巧操作,少量数据微调就能部署成功
本站未展示全文,请前往来源网站阅读。
微软亚洲研究院与清华大学提出 VITRA 预训练框架,将海量无标注真实人类活动视频自动转化为与机器人 V-L-A 训练格式对齐的数据,构建了包含 100 万个片段、2600 万帧的手部 V-L-A 数据集。
来源:量子位 · 微信公众号 · mp.weixin.qq.com