跨会议持久说话人归属评估:SI-cpWER 基准与 ThyVoice 参考系统
研究提出 Speaker Identified cpWER(SI-cpWER)指标,在单一全局说话人 ID 分配下评估跨会议持久说话人归属,覆盖 CHiME-8 NOTSOFAR 全部 129 场会议(干净与加噪两种形式)及 CHiME-6。
研究提出 Speaker Identified cpWER(SI-cpWER)指标,在单一全局说话人 ID 分配下评估跨会议持久说话人归属,覆盖 CHiME-8 NOTSOFAR 全部 129 场会议(干净与加噪两种形式)及 CHiME-6。
LEAP 通过将录音切分为固定时长块、用轻量定位阶段为每块候选窗口打分,再把高分窗口汇聚后单次有界重编码作答,使答案输入与峰值上下文不随录音时长增长。在多个 AVQA 基准上,LEAP 较 Qwen3-Omni-30B-A3B 基线提升 4.5-16.8%,迁移到 MiniCPM-o 4.5 后超出其已发表结果 3.1-13.0%。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源多语言 TTS 和语音克隆模型。指标包括基于 Qwen3 ASR 的 WER/CER、H200 上的 RTFx 和 TTFA 流式延迟、WavLM 嵌入的说话人相似度(SIM),把评估周期从数周缩短到数小时。
Tacit-TTS 是一个从 IndexTTS2 蒸馏而来的无转写零样本语音克隆系统,用掩码非自回归生成替代自回归文本到语义解码,并引入免训练声学长度估计与 ReFlow 蒸馏加速流匹配渲染器。在四个中英文数据集上,其对超过 5 秒的语句生成速度比 IndexTTS2 快 10 倍以上,同时保持有竞争力的零样本质量。无转写条件还支持跨语言及非词汇参考,如其他八种语言、婴儿咿呀声和合成乱语。
一篇综述将联合生成、跨模态生成与联合编辑统一形式化为音视频对分布上的三类问题,并提出沿五个设计轴比较方法的分类体系。该工作称首次系统梳理联合音视频编辑,将其划分为九类编辑、涵盖 28 种编辑类型,并整理了各设定的方法、数据集与指标。
Apple 研究团队提出潜空间蒸馏方法压缩流式神经音频编码器(tokenizer),以教师模型量化前的逐帧潜表示为监督目标,仅训练学生编码器做回归,并用单层仿射层吸收师生宽度差异。在 2.8 倍压缩下,六组师生配对中有五组无需微调即保持在教师 1.9% 相对 WER 以内,并比同容量独立训练编码器相对提升 3.9%。该方法同时适用于独立预训练和与语言模型联合训练的 tokenizer。
Apple 研究团队提出半监督联邦 ASR 训练方案,通过在线伪标签教师与服务端标注数据锚定更新两条耦合设计轴,解决伪标签误差跨序列、跨轮次累积导致的训练发散问题。该方案在 11 组对比中 9 组优于此前最强方法,域内平均提升 20.8%、跨域提升 10.0%,缩小了与全监督联邦学习的差距。
Hugging Face 提出三项测试量化 ASR 模型的基准优化(benchmaxxing)行为,评估 11 个开源模型后发现多个高分模型会复现 VoxPopuli 和 LibriSpeech 的错误参考转写。
推荐理由:原文给出三种可量化的探针方法,让读者能据此区分语音模型的真实转写能力与针对基准的拟合行为。
Hugging Face 团队推出 Real World VoiceEQ 基准,评估语音交互的人类化质量,覆盖 40 多个专有和开源语音模型、15+ 维度和 60 多项指标,涉及 ASR、TTS、S2S 和语音理解。
Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。
推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。
Sierra 开源 μ-Bench,包含来自 250 通真实客服电话的 4,270 条人工标注语音,覆盖英语、西班牙语、土耳其语、越南语和普通话,评测 Deepgram Nova-3、Google Chirp-3、Azure Speech、ElevenLabs Scribe v2 和 OpenAI GPT-4o Mini Transcribe。
Sierra 发布 𝜏³-Bench,在 𝜏-Bench 基础上新增 𝜏-Knowledge 与 𝜏-Voice 两个评测域,并合入社区对原有 airline、retail、telecom 任务的修复。