跳到正文
Hugging Face Daily Papers·· 9 天前AI 评分46

VLA 强化学习的低秩结构:RL 如何重塑 VLA 策略

The Low-Rank Structure of VLA Reinforcement Learning

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究发现,在 LIBERO、ManiSkill、MetaWorld 和 CALVIN 上对 π0.5、GR00T N1.5/N1.6 等 flow-based VLA 模型做 RL 后训练,会产生秩显著更低的参数更新,且高度集中在 action expert 的 Timestep Modules 中。

来源:Hugging Face Daily Papers · arxiv.org