跳到正文
Hugging Face Daily Papers·· 22 天前AI 评分55

StepAudio 3 Gen 技术报告:统一多种音频生成的自回归模型

StepAudio 3 Gen Technical Report

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

StepAudio 3 Gen 技术报告发布,该模型在统一框架内支持零样本 TTS、音色设计、人声生成、音效和音乐等多种音频生成任务。其核心是离散自回归生成器,直接对 RVQ token 建模,区别于近期通用音频模型常用的扩散 Transformer 连续生成范式。

来源:Hugging Face Daily Papers · arxiv.org