字节 Seed 发布音频创作模型 Seed Audio 1.0,统一生成人声、音效和环境声
从“会说”走向“会创作”| Seed Audio 1.0 音频创作模型发布
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
字节 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,端到端生成完整声音场景。模型支持 100ms 间隔的时间控制、零样本音色生成、单次约 2 分钟的延展生成,覆盖 20+ 语种;评测显示多数场景音频可用率达 90% 以上,多语种自然度 MOS 大部分超过 4 分。模型已在火山方舟体验中心上线。
推荐理由
官方介绍统一框架下联合建模多种音频要素的思路,并给出时间控制精度、语种覆盖和评测数字,可用于了解音频创作模型的能力边界。
来源:ByteDance Seed Research · seed.bytedance.com