跳到正文
Hugging Face Daily Papers·· 1 天前AI 评分38

RLHND:以视频基础模型作为物理接地的机器人学习手部追踪器

RLHND: Video Foundation Models as Physically Grounded Hand Trackers for Robot Learning

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者提出 RLHND,一种基于视频基础模型的手部追踪模型,可从单目第一视角视频中联合估计手部姿态与真实触觉信息。它通过 clean-latent conditioning 将预训练的 Cosmos 3 视频扩散骨干转为确定性片段级特征提取器,并用独立触觉专家流预测手部表面的密集接触与力。RLHND 在姿态估计及接触与力估计的多项基准数据集上均达到 SOTA,代码将公开。

来源:Hugging Face Daily Papers · arxiv.org