FailBank:用运行时反馈自进化提升 VLA 模型安全性与成功率
Learning from Runtime Feedback through Failure-Bank Self-Evolution for Vision-Language-Action Models
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
针对 VLA 模型中运行时安全屏蔽与策略不匹配的问题,研究者提出四阶段自进化框架 FailBank,将运行时反馈转化为持久的策略改进。在 VLA-Arena 基准的两个难度等级和两个 VLA 主干上,FailBank 将任务成功率分别提升 8.5 和 6.9 个百分点,策略引发的累计成本降低 35.6% 和 23.8%;相比运行时屏蔽,成功率提升 25.4 和 9.5 个百分点。
来源:Hugging Face Daily Papers · arxiv.org