Suno 发布 v6 下一代音乐模型,推出 v6、v6-wild、v6-mini 三档
Suno 发布 v6 新一代音乐模型,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,并最终以下一代模型替换旧模型。
推荐理由:原文由官方给出三档模型分工与具体编辑能力示例,读者可以据此判断新工作流是否适合自己。
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
当前仅显示精选新闻Suno 发布 v6 新一代音乐模型,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,并最终以下一代模型替换旧模型。
推荐理由:原文由官方给出三档模型分工与具体编辑能力示例,读者可以据此判断新工作流是否适合自己。
推荐理由:谷歌把整曲生成模型 Lyria 3.5 同步铺到 AI Studio、Gemini app 与 API,可据此观察音乐生成在消费端和接口层的落地方式。
Gemini Live 面向全球免费开放。各集成功能的可用范围、兼容性和年龄限制存在差异,部分集成可能需要完成设置或订阅。官方博客给出了具体使用方式。
推荐理由:Gemini Live 免费向全球开放,读者可据此了解各集成功能在可用范围与年龄限制上的差异。
Google 发布 Gemini 3.5 Transcribe,一款不再逐字记录、而是输出用户本意的语音转写模型,现已通过 API 开放。

Say hello to Gemini 3.5 Transcribe! - Build apps that understand user speech / intent, even w/ multiple speakers! - Auto-detection of 85+ languages out of the box - Custom vocab adaptation for specialized jargon... SGTM:) API available now in @GoogleAIStudio and Gemini Enterprise, or try it in the Gemini app on macOS or Rambler on Android! More details: https://t.co/AduutCb3M7
推荐理由:原文列出两个 API 端点各自的能力与时长限制,读者可据此判断语音转写在工作流中的可用边界。
Google DeepMind 推出语音转文字模型 Gemini 3.5 Transcribe,定位为更精确的实时转写模型,已在 Gemini API(Google AI Studio 和 Gemini Enterprise Agent Platform)开启公开预览。
推荐理由:官方给出了两个 API 入口、WER 数字和与 Chirp 3 的对比,读者可据此评估其语音转写与语音交互场景的可用性。
FireRedTeam 发布 FireRedAudio,一个基于共享 9B LLM 的通用音频语言模型,采用解耦连续表示,Audio Encoder 负责理解、RedAE 通路负责生成。
推荐理由:原文给出模型架构设计和多基准评测数据,并附完整开源代码,读者可据此评估其音频理解与生成能力。
Hugging Face 提出三项测试量化 ASR 模型的基准优化(benchmaxxing)行为,评估 11 个开源模型后发现多个高分模型会复现 VoxPopuli 和 LibriSpeech 的错误参考转写。
推荐理由:原文给出三种可量化的探针方法,让读者能据此区分语音模型的真实转写能力与针对基准的拟合行为。
xAI 发布 Voice Agent Builder 测试版,这是在 Grok Voice 上配置生产级语音智能体的无代码平台,内置电话、知识库检索、工具、护栏、MCP 和可观测性。
推荐理由:xAI 把电话、知识库、工具与护栏收进同一个语音接口,并给出单价和基准对比,便于判断落地成本。
xAI 发布 Grok Voice Agent API,开发者可用它构建支持数十种语言、调用工具并实时搜索数据的语音智能体。该 API 按每分钟 0.05 美元的固定费率计费,平均首音频延迟低于 1 秒,在 Big Bench Audio 排名第一。
推荐理由:xAI 把已在特斯拉和移动端使用的语音栈开放为 API,开发者可据此评估自建语音智能体的延迟与成本。
xAI 发布 Grok Speech to Text 和 Text to Speech 两个独立音频 API,开发者可通过 REST 与 WebSocket 接口接入语音转写和语音合成。
推荐理由:原文给出两个音频 API 的定价与多领域词错率对比,便于开发者判断接入成本与场景适配。
xAI 发布 Grok 4 与 Grok 4 Heavy,用 20 万 GPU 集群 Colossus 把强化学习训练扩展到预训练规模,训练算力效率提升 6 倍。
推荐理由:原文给出强化学习规模化的训练细节与多项基准成绩,可了解 Grok 4 的推理与工具调用取向。
xAI 发布旗舰语音模型 grok-voice-think-fast-1.0,主打复杂多轮语音工作流、低响应延迟与高并发工具调用,可在客服、电话销售和企业场景中部署。
推荐理由:在发布新语音模型的同时给出 τ-voice Bench 排名和 Starlink 客服销售的实际部署数字,便于对照同类语音智能体。
xAI 发布新一代语音模型 Grok Voice Think Fast 2.0,称其在语音推理、转录准确率和对话能力上较 1.0 有明显提升。该模型在 Artificial Analysis 语音到语音质量指数上为 82.9%,首字延迟 0.70s,转录准确率相对 Deepgram Nova 3 与 ElevenLabs Scribe v2 提升 1.5–2.0 倍。
推荐理由:相比 1.0 与 GPT-Realtime-2.1,原文给出了语音质量、推理效率与首字延迟的对比数据,可供语音智能体选型参考。
FireRedTeam 发布 FireRedTTS3 的 PyTorch 代码与模型,基于语义增强连续语音表示,统一语音生成与编辑,含 Base 和 Instruct 两个变体,采用 Apache-2.0 许可。
推荐理由:仓库给出完整评测数字和安装使用入口,读者可以据此评估它在多语言克隆和语音编辑上的实际表现。
Suno 发布 Studio 2.0,现向 Premier 订阅者开放。新增时间线 MIDI 导入、录制与编辑,可用 MIDI 剪辑作为生成提示词,附带新的 wavetable 合成器;另推出 Chat bar(beta)协作创作、高级 stem 分离、音频效果与自定义插件、自动化曲线,并支持无损导出 32-bit/48kHz 多轨与 stems。插件创建目前不消耗 credits。
推荐理由:官方发布新增 MIDI、Chat bar、自动化等能力,音乐创作者可据此判断 Suno Studio 2.0 是否融入现有工作流。
Suno 官方宣布与大型音乐公司 BMG 达成全球合作伙伴关系,该合作是 Suno 即将推出的首个与音乐行业共同开发的音乐模型的一部分。双方将共同打造连接艺术家与粉丝的新体验,并为选择加入的艺术家和词曲作者创造新的经济机会,同时深化 Suno: In Session 和 Spark 等对独立艺术家的支持项目。
推荐理由:Suno 官方宣布与 BMG 达成全球合作,说明合作将伴随其首个与音乐行业共同开发的音乐模型推出,可据此了解 AI 音乐公司与版权方的合作模式。
Suno 官宣 9 月 3 日起按订阅档位实施下载限额,Free 用户终身仅 7 次试用下载,Pro 每月 20 次,Premier 每月 60 次,Suno Studio 无下载限制,超出部分可购买。同时推出新服务条款,付费计划下载的歌曲保留商用权,此前所有歌曲仍可播放和分享;新一代 Suno 模型即将上线,发布时旧模型将全部退役。
推荐理由:官方说明给出各档下载限额、免费用户终身额度等关键细节,对现有用户判断订阅与商用权利有直接参考价值。
ByteDance Seed 发布原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,支持音视频联合理解、主动交互与流畅对话节奏。端到端人工评测显示,相比级联模型,音视频对话节奏问题减少一半。模型已在豆包 App 全量上线,用户更新后在对话框选择“打电话”进入视频通话即可体验。
推荐理由:原文给出统一架构、端到端评测数字和豆包 App 开放入口,可据此了解音视频全双工交互的能力与体验变化。
Microsoft AI 发布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash,两款模型均进入公开预览。
推荐理由:原文给出两款新模型的定价、性能数字和产品落地情况,可据此比较其质量速度成本取舍。
Black Forest Labs 发布多模态基础模型 FLUX 3 并开放 Early Access,基于 Self-Flow 方法在统一架构下同时学习图像、视频和音频。
推荐理由:官方公布了 FLUX 3 的多模态架构、早期评测胜率和分阶段开放计划,读者可以据此评估它在视频与物理 AI 方向的路径。