跳到正文
Hugging Face Daily Papers·· 6 天前AI 评分38

DEFINE:用示例音频解耦说话人与口音的零样本 TTS 框架

DEFINE: Exemplar-Guided Accent Control for Zero-Shot TTS

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

DEFINE 是一个端到端零样本 TTS 框架,通过分别以不同音频示例作为说话人身份和目标口音的条件,将两者解耦,并用单一推理期引导权重连续控制口音强度而无需重训练。

来源:Hugging Face Daily Papers · arxiv.org