VLA 强化学习的低秩结构:RL 如何重塑 VLA 策略
The Low-Rank Structure of VLA Reinforcement Learning
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究发现,在 LIBERO、ManiSkill、MetaWorld 和 CALVIN 上对 π0.5、GR00T N1.5/N1.6 等 flow-based VLA 模型做 RL 后训练,会产生秩显著更低的参数更新,且高度集中在 action expert 的 Timestep Modules 中。
来源:Hugging Face Daily Papers · arxiv.org