Motion-Omni:端到端联合语音与全身动作的口语对话
Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Motion-Omni 提出端到端框架,让口语对话模型直接从生成语音的隐状态输出面部表情以及手部、上半身和下半身动作,不再需要先生成语音再跑动作模型的级联流程。
来源:Hugging Face Daily Papers · arxiv.org