跳到正文
Hugging Face Daily Papers·· 7 天前AI 评分50

VoxMem:大音频语言模型多模态记忆基准测试

VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

VoxMem 基准发布,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索和环境声四类声学证据,以及信息提取、多会话推理、时间追踪和拒答四种记忆操作,上下文预算从 8K 到 64K tokens。评测 15 个 LALM,无一模型在 32K 下超过 40%,模型对"说了什么"的保留远好于"谁说的、怎么说的、听到了什么"。

来源:Hugging Face Daily Papers · arxiv.org