StepAudio 3 Gen 技术报告:统一多种音频生成的自回归模型
StepAudio 3 Gen Technical Report
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
StepAudio 3 Gen 技术报告发布,该模型在统一框架内支持零样本 TTS、音色设计、人声生成、音效和音乐等多种音频生成任务。其核心是离散自回归生成器,直接对 RVQ token 建模,区别于近期通用音频模型常用的扩散 Transformer 连续生成范式。
来源:Hugging Face Daily Papers · arxiv.org