ReImaGin:用图像生成模型为多模态 LLM 提供灵活视觉推理能力
Reasoning with Image Generation
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
多模态 LLM 推理框架 ReImaGin 提出用图像生成模型替代深度估计、目标检测等固定功能视觉工具,通过自然语言指令完成去遮挡、由多视角生成户型图等开放式视觉操作。在包括多视角空间推理和碰撞预测在内的六项视觉推理任务上,ReImaGin 一致优于纯文本推理和专用视觉工具基线,最高提升 25%。该工作已被 COLM 2026 接收,代码与网站已公开。
来源:Hugging Face Daily Papers · arxiv.org