跳到正文
原文
Hugging Face Daily Papers·· 7 天前AI 评分46

音频 LLM 会先听再行动吗?VGBench 诊断语音智能体的声学上下文门控

Do Audio LLMs Listen Before They Act? Diagnosing Acoustic-Context Gating in Voice Agents

AI 导读

研究者提出 VGBench,一个含 1,018 条样本的诊断基准,用于评测语音智能体在闲聊、自言自语和说话人切换场景下的动作级"被称呼"判断。六款原始 Audio LLM 和三种免训练适配方案常能识别目标工具,却很少在说话人切换时抑制动作,最高静默率仅 14%。

来源:Hugging Face Daily Papers · arxiv.org