Higgs Audio v3 TTS 上线 SGLang-Omni,支持实时流式语音与控制标签
Boson AI 与 SGLang-Omni 团队宣布在 SGLang-Omni 上提供 Higgs Audio v3 TTS 的端到端服务。模型约 4B 参数,基于 Qwen3-4B,支持流式合成和 100 种语言的个位数 WER/CER,零样本克隆在 Seed-TTS 上 WER/CER 为 1.11%。
推荐理由:原文给出多级推理架构、控制标签目录和基准延迟数据,开发者可据此评估把 TTS 接入语音 Agent 的可行性。