跳到正文
量子位 · 微信公众号·· 2026-06-08AI 评分55

微软亚洲研究院与清华提出 VITRA,用纯人类视频预训练 VLA 实现灵巧操作

首次!纯人类视频预训练VLA灵巧操作,少量数据微调就能部署成功

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

微软亚洲研究院与清华大学提出 VITRA 预训练框架,将海量无标注真实人类活动视频自动转化为与机器人 V-L-A 训练格式对齐的数据,构建了包含 100 万个片段、2600 万帧的手部 V-L-A 数据集。

来源:量子位 · 微信公众号 · mp.weixin.qq.com