跳到正文
Hugging Face Daily Papers·· 2026-09-03AI 评分31

KBMR:面向知识型视觉问答的实体对齐检索模型,Recall@1 提升 14.7%

Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者提出 KBMR,首个专为知识型视觉问答(KB-VQA)设计的基于 MLLM 的嵌入检索器,将图像映射到更能保留概念身份的语义空间。针对 Wikipedia 规模检索中的噪声监督,KBMR 引入基于 MLLM 的语义判别器生成连续实体一致性权重,并据此设计连续语义蒸馏目标。

来源:Hugging Face Daily Papers · arxiv.org