跳到正文
Hugging Face Daily Papers·· 2026-08-21AI 评分37

EXIMO:用 VLM 引导 VLA 策略的探索式微调

EXIMO: VLM Guided Exploration of VLA Policies

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

EXIMO 是一种面向 VLA 策略的高效微调算法,分探索、模仿、优化三阶段:探索阶段由 VLM 充当规划器,把长时程任务拆解为短任务,并与 VLA 协同采集数据集;模仿阶段用该数据微调 VLA;优化阶段再用残差 off-policy RL 进一步微调。实验显示其在样本效率和最终性能上显著优于现有方法。

来源:Hugging Face Daily Papers · arxiv.org