WM-VLM:为交错视觉-文本推理探测内部世界模型
WM-VLM: Probing Internal World Models for Interleaved Visual-Textual Reasoning
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出 WM-VLM,为预训练 VLM 加装轻量级世界模型分支以生成中间视觉状态,并采用两阶段训练:先学生成下一视觉状态,再据此推理。在 2D 和 3D 心理旋转任务上,WM-VLM 持续优于监督微调的骨干模型,提升最高达 39.25 个百分点;消融实验显示移除或破坏生成的视觉状态会显著降低性能。
来源:Hugging Face Daily Papers · arxiv.org