OmniAssistBench:面向 Omni-LLM 的助手式交互基准
OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者推出 OmniAssistBench,用于评测 Omni-LLM 作为实时视频助手的交互能力,通过逆向拆解互联网视频构建多轮交互数据,耗时超 1000 专家人时。测试中 Gemini-3-Pro 得 66.4 分(满分 100),开源 Qwen3-Omni-Instruct 得 51.2 分。模型普遍能理解用户输入,但在手势等视觉提示、多轮历史上下文保持和延迟到目标事件再响应上仍频繁出错。
来源:Hugging Face Daily Papers · arxiv.org