VoxMem:大音频语言模型多模态记忆基准测试
VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
VoxMem 基准发布,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索和环境声四类声学证据,以及信息提取、多会话推理、时间追踪和拒答四种记忆操作,上下文预算从 8K 到 64K tokens。评测 15 个 LALM,无一模型在 32K 下超过 40%,模型对"说了什么"的保留远好于"谁说的、怎么说的、听到了什么"。
来源:Hugging Face Daily Papers · arxiv.org