Hugging Face Daily Papers·· 7 天前AI 评分46
音频 LLM 会先听再行动吗?VGBench 诊断语音智能体的声学上下文门控
Do Audio LLMs Listen Before They Act? Diagnosing Acoustic-Context Gating in Voice Agents
AI 导读
研究者提出 VGBench,一个含 1,018 条样本的诊断基准,用于评测语音智能体在闲聊、自言自语和说话人切换场景下的动作级"被称呼"判断。六款原始 Audio LLM 和三种免训练适配方案常能识别目标工具,却很少在说话人切换时抑制动作,最高静默率仅 14%。
来源:Hugging Face Daily Papers · arxiv.org