跳到正文
Hugging Face Daily Papers·· 7 天前AI 评分46

ReImaGin:用图像生成模型为多模态 LLM 提供灵活视觉推理能力

Reasoning with Image Generation

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

多模态 LLM 推理框架 ReImaGin 提出用图像生成模型替代深度估计、目标检测等固定功能视觉工具,通过自然语言指令完成去遮挡、由多视角生成户型图等开放式视觉操作。在包括多视角空间推理和碰撞预测在内的六项视觉推理任务上,ReImaGin 一致优于纯文本推理和专用视觉工具基线,最高提升 25%。该工作已被 COLM 2026 接收,代码与网站已公开。

来源:Hugging Face Daily Papers · arxiv.org