让全双工语音模型"听见自己":Self-Listening 解决打断后的锚定难题
What Did I Just Say? Self-Listening for Full-Duplex Speech Models
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
针对全双工语音模型文本生成、语音合成与音频播放异步导致"自认为说过"与"用户实际听到"不一致的问题,研究者提出 Self-Listening 建模方法,将模型已播放的语音作为输入流回喂,使打断恢复锚定在用户真实听到的内容上。
来源:Hugging Face Daily Papers · arxiv.org