跳到正文
原文
inclusionAI Hugging Face models·· 2026-06-15精选AI 评分65

inclusionAI 发布 Ming-omni-tts-16.8B-A3B 统一音频生成模型

inclusionAI/Ming-omni-tts-16.8B-A3B

AI 导读

inclusionAI 发布 Ming-omni-tts-16.8B-A3B 统一音频生成模型,可在单通道内联合合成语音、环境声与音乐。模型基于自研 12.5Hz 连续 tokenizer 与 Patch-by-Patch 压缩,将 LLM 推理帧率降至 3.1Hz,并内置 100+ 音色与零样本语音设计。

推荐理由

该模型在单通道内联合生成语音、环境声与音乐,并用方言与情感控制基准对比 CosyVoice3 与 Qwen3-TTS。

来源:inclusionAI Hugging Face models · huggingface.co