跳到正文
Hugging Face Daily Papers·· 7 天前AI 评分43

StructRL:面向长时程视觉-语言-动作任务的在线结构化强化学习

StructRL: Online Structured Reinforcement Learning for Long-Horizon Vision-Language-Action Tasks

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

StructRL 是一个在线强化学习框架,通过将任务分解为可验证子任务、在完成前置子任务后给予中间奖励并按完成速度缩放奖励,为长时程 VLA 任务提供结构化中间监督。在 RoboCasa365 和 LIBERO-Long 上,配合 GR00T-N1.5 与 pi 0.5,StructRL 持续优于所评估的在线 RL 基线。代码已开源。

来源:Hugging Face Daily Papers · arxiv.org