跳到正文
Hugging Face Daily Papers·· 27 天前AI 评分46

SimpleMemVLA:为视觉-语言-动作模型提供原生视频记忆的简单有效方案

SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

SimpleMemVLA 提出一种无需专用记忆模块的 VLA,直接以 backbone 原生视频上下文作为记忆,将历史保留为带时间戳的视频格式,并通过生成子任务的隐藏状态把证据路由到 flow-matching 动作头。

来源:Hugging Face Daily Papers · arxiv.org