OneSearch-VL:面向图像与视频的统一多模态深度研究智能体
OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
OneSearch-VL 是一个以视觉锚定证据图(VGEG)为核心的多模态深度研究智能体,统一处理单图、多图和视频研究任务。其 8B 版本在两个新基准 OneSearch-MI-Bench 和 OneSearch-Video-Bench 上分别比带工具访问的 Qwen3-VL-8B 高出 20.2 和 17.6 个百分点,并在 7 个图像基准和 VideoDR 上取得显著提升。
来源:Hugging Face Daily Papers · arxiv.org