VibeVoice-ASR-Streaming 技术报告提出 LLM 端到端流式说话人归属 ASR,开源 1.5B 与 7B 权重
VibeVoice-ASR-Streaming Technical Report
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
VibeVoice-ASR-Streaming 技术报告提出一种基于 LLM 的端到端流式说话人归属 ASR 方法,将固定大小音频块、少量前瞻音频与历史文本交错输入,无需独立说话人分离阶段即可在语音到达时输出谁说了什么。7B 模型在五个评测集上取得最低平均 WER/CER,说话人归属在 13 项评测设置中有 12 项最佳或并列最佳。团队同时开源 1.5B 与 7B 模型权重及推理代码。
来源:Hugging Face Daily Papers · arxiv.org