DEFINE:用示例音频解耦说话人与口音的零样本 TTS 框架
DEFINE: Exemplar-Guided Accent Control for Zero-Shot TTS
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
DEFINE 是一个端到端零样本 TTS 框架,通过分别以不同音频示例作为说话人身份和目标口音的条件,将两者解耦,并用单一推理期引导权重连续控制口音强度而无需重训练。
来源:Hugging Face Daily Papers · arxiv.org
DEFINE: Exemplar-Guided Accent Control for Zero-Shot TTS
本站未展示全文,请前往来源网站阅读。
DEFINE 是一个端到端零样本 TTS 框架,通过分别以不同音频示例作为说话人身份和目标口音的条件,将两者解耦,并用单一推理期引导权重连续控制口音强度而无需重训练。
来源:Hugging Face Daily Papers · arxiv.org