CoVeR:面向 VLM 多视图 3D 推理的覆盖率 token 剪枝
CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMs
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
CoVeR 是一种无需训练、确定性的视觉 token 选择器,仅利用 token 坐标实现多视图 3D 场景的覆盖率剪枝。在三个 3D 推理基准上,它仅保留约 8% 的视觉 token 即可维持全量 token 93.5% 的性能,平均超越此前 SOTA 3.9 个百分点,并可作为即插即用模块适配四种 VLM。
来源:Hugging Face Daily Papers · arxiv.org