Hugging Face 发布 Open TTS Leaderboard:可扩展的多语言 TTS 与语音克隆评估
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源多语言 TTS 和语音克隆模型。指标包括基于 Qwen3 ASR 的 WER/CER、H200 上的 RTFx 和 TTFA 流式延迟、WavLM 嵌入的说话人相似度(SIM),把评估周期从数周缩短到数小时。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源多语言 TTS 和语音克隆模型。指标包括基于 Qwen3 ASR 的 WER/CER、H200 上的 RTFx 和 TTFA 流式延迟、WavLM 嵌入的说话人相似度(SIM),把评估周期从数周缩短到数小时。
SpatialCORE 是一个后训练框架,将模型对生成式 grounding 的自身置信度转化为空间推理的学习信号,通过自调节空间奖励按坐标 token 置信度加权每个预测边界框的匹配质量,并用答案门控将 grounding 优化与最终答案正确性绑定。该框架在多个基准上取得开源及专用空间推理模型中的 SOTA 结果,并可零样本迁移到未见数据分布,源代码已公开。
Hugging Face 发布 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实真实但被归因到错误来源的问题。在 281 条医疗智能体真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在四项对比检查器中取得最高分。
HuggingFace 上开源了一个用 Claude Opus 5.5 生成的模拟医患对话数据集,覆盖 2194 种疾病,平均每段 33 轮,从描述症状、检查聊到治疗和后续安排。
英国 AI 安全研究所(AISI)宣布使用 EvalEval 的 Evaluation Cards 开放共享评测结果,以支持更可复现、可验证的评测科学。
IBM Research 在 ALTK-Evolve 中新增 Consistency Analyzer 和一致性指南,用于衡量并改善智能体重复执行同一任务时的稳定性。
推荐理由:原文给出 Pass^k 与 Mean@k 的区别和一种只靠单条轨迹、无需标注的稳定性诊断方法,可将智能体一致性缺口缩小约一半。
Allen AI 发布 BenchMIRT,一种基于多维 IRT 的方法,用于在单个题目层面审计 LLM 基准实际测量的能力。方法基于 100 个 LLM 在 16 个基准、超 34K 题目上的结果训练,未事先告知标签即独立恢复出安全与通用推理两个维度;分析发现 BBQ 和 WMDP 与通用推理的关联强于安全,HarmBench 的版权题也更接近推理。
Voice Arena 与 Hugging Face 在 Open ASR Leaderboard 推出 Monsoon en-IN 和 Monsoon hi-IN 两套评测集,共 4 个 split、4,888 名说话人、约 17 小时对话语音,印地语成为多语言标签页里第一个南亚语言。
Hugging Face 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 压缩至 60B 参数并量化为 MXFP4 后,在 9 项基准中的 7 项超过其 bfloat16 全精度版本。
Hugging Face 提出三项测试量化 ASR 模型的基准优化(benchmaxxing)行为,评估 11 个开源模型后发现多个高分模型会复现 VoxPopuli 和 LibriSpeech 的错误参考转写。
推荐理由:原文给出三种可量化的探针方法,让读者能据此区分语音模型的真实转写能力与针对基准的拟合行为。
IBM Research 在 AppWorld 上自跑对比 ALTK-Evolve 与 ACE,两者都把智能体历史轨迹转成可复用经验且都不压缩经验,核心差异在交付:ACE 每步注入完整 playbook,ALTK-Evolve 按模型能力选择性检索 guideline。
Hugging Face 团队推出 Real World VoiceEQ 基准,评估语音交互的人类化质量,覆盖 40 多个专有和开源语音模型、15+ 维度和 60 多项指标,涉及 ASR、TTS、S2S 和语音理解。