TAMP-Nav:面向高效具身导航的 Point、Think、Memorize 与 Align 框架
Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出统一具身导航框架 TAMP-Nav,通过 Pixel-to-3D 动作公式让 VLM 只选 2D 像素再投影为 3D 坐标交由 SLAM 控制器执行,并引入选择性推理与 Anchor-Trajectory 记忆机制及基于 GRPO 的两级对齐范式。该框架在 R2R-CE 上达到 66.2% SR 的 SOTA 表现,仅需 90k 训练轨迹,兼具运行时与样本效率。
来源:Hugging Face Daily Papers · arxiv.org