小米开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
小米发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,用于解决多人同时说话时识别率大幅下降的鸡尾酒会问题。该模型采用端到端 LLM 架构,以目标说话人的一段参考音频作为声纹提示,可在复杂环境中精准提取并仅转录目标用户的语音。官方称其在多个主流多说话人测试集上达到 SOTA,单人识别性能比肩标准 ASR 模型,还支持拒识非目标说话人干扰语音和思维链推理模式。
来源:IT Home · ithome.com