跳到正文
Hugging Face Daily Papers·· 1 天前AI 评分45

OneSearch-VL:面向图像与视频的统一多模态深度研究智能体

OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

OneSearch-VL 是一个以视觉锚定证据图(VGEG)为核心的多模态深度研究智能体,统一处理单图、多图和视频研究任务。其 8B 版本在两个新基准 OneSearch-MI-Bench 和 OneSearch-Video-Bench 上分别比带工具访问的 Qwen3-VL-8B 高出 20.2 和 17.6 个百分点,并在 7 个图像基准和 VideoDR 上取得显著提升。

来源:Hugging Face Daily Papers · arxiv.org