跳到正文
Hugging Face Daily Papers·· 2026-08-24AI 评分39

OmniAssistBench:面向 Omni-LLM 的助手式交互基准

OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者推出 OmniAssistBench,用于评测 Omni-LLM 作为实时视频助手的交互能力,通过逆向拆解互联网视频构建多轮交互数据,耗时超 1000 专家人时。测试中 Gemini-3-Pro 得 66.4 分(满分 100),开源 Qwen3-Omni-Instruct 得 51.2 分。模型普遍能理解用户输入,但在手势等视觉提示、多轮历史上下文保持和延迟到目标事件再响应上仍频繁出错。

来源:Hugging Face Daily Papers · arxiv.org