Sierra 发布 𝜏-voice 基准,在真实语音条件下评测实时语音 Agent
Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。
推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。
Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。
推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。
Sierra 开源 μ-Bench,包含来自 250 通真实客服电话的 4,270 条人工标注语音,覆盖英语、西班牙语、土耳其语、越南语和普通话,评测 Deepgram Nova-3、Google Chirp-3、Azure Speech、ElevenLabs Scribe v2 和 OpenAI GPT-4o Mini Transcribe。
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,改进可控性、表现力和质量,在 Artificial Analysis TTS 排行榜获得 1,211 Elo 分。
推荐理由:官方介绍新增 audio tags 和多说话人对话能力,还给出 AI Studio 导演式控制与 API 导出的具体用法,便于开发者评估接入。
Microsoft AI 宣布发布 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2 三款模型,现已在 Microsoft Foundry 和 MAI Playground 开放。
推荐理由:官方公布三款 MAI 模型的 Foundry 定价与基准对比,开发者可直接据此评估接入成本和可用性。
Microsoft 发布语音识别模型 MAI-Transcribe-1,定价 $0.36 每小时音频,称其在大规模云厂商中具备最优性价比。模型正在 Copilot Voice 模式和 Microsoft Teams 中分阶段部署,并已在 Microsoft Foundry 公开预览,同时可在新上线的 Microsoft AI Playground 体验。
Suno 发布 v5.5 模型,同时推出三项个性化功能。Voices 让用户采集自己的声音来创作音乐,包含验证流程且默认私密,面向 Pro 和 Premier 订阅者;Custom models 可基于自有曲目调出个性化模型,最多可建三个;My Taste 根据用户偏好学习风格,面向所有用户。官方称这些能力为今年晚些时候与音乐行业合作推出的新一代音乐模型打基础。
推荐理由:原文交代了新功能的具体机制与订阅限制,读者可据此判断如何用自己的声音和风格来创作音乐。
Mistral AI 发布 4B 参数的文本转语音模型 Voxtral TTS,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,API 定价 $0.016 per 1k characters。
推荐理由:官方给出了与 ElevenLabs 对比的人类评测数据和低延迟指标,读者可据此评估其在语音 Agent 场景的可用性。
Sierra 发布 𝜏³-Bench,在 𝜏-Bench 基础上新增 𝜏-Knowledge 与 𝜏-Voice 两个评测域,并合入社区对原有 airline、retail、telecom 任务的修复。
Suno 为 Premier 订阅者的 Suno Studio 推出 1.2 版本,新增 Remove FX 可去除音频片段效果并导出无效果版本至 DAW,Warp Markers 支持配合 Quantize 调整音频时序与律动。该版本还引入 Alternates 优化 take lanes 试听流程,并支持 4/4 以外的拍号,如 6/8、7/8 和 11/4。
Mistral 发布 Voxtral Transcribe 2 系列,包含 Voxtral Mini Transcribe V2(批量转写)和 Voxtral Realtime(实时转写),支持 13 种语言的说话人分离、上下文偏置和词级时间戳。
推荐理由:官方给出了两个语音转写模型的具体延迟、错误率和价格,并开放了 Voxtral Realtime 权重,便于按场景选型。
Suno 宣布与 Warner Music Group(WMG)达成新合作,将用高质量授权音乐训练新一代模型,称其将超越目前最好的 v5。WMG 艺人可自愿授权姓名、形象、声音和作品用于 AI 生成音乐并获得新收入;未来下载歌曲需付费账号,各付费档位含每月下载额度,Suno Studio 保持不变并保留无限下载。
推荐理由:Suno 官方说明与 Warner Music Group 合作后的产品变化,包括付费下载门槛和授权模型计划,读者可据此调整使用方式。
Suno 宣布完成 2.5 亿美元 Series C 融资,投后估值 24.5 亿美元,由 Menlo Ventures 领投,NVentures(NVIDIA 风投部门)、Hallwood Media、Lightspeed 和 Matrix 参投。过去两年近 1 亿人在 Suno 上创作过音乐,公司称将用新资金为专业音乐人开发更复杂的工具、改善休闲创作者体验,并建设音乐社交与分享生态。
推荐理由:官方公告给出融资金额、估值和投资方名单,并说明资金将投向专业工具与社交功能的扩展方向。
Suno 宣布推出 Suno Studio,定位为生成式音频工作站,将 AI 生成融入音乐创作流程。它支持即时生成人声、鼓、合成器等无限 stem 变体,提供多轨时间线编辑、BPM、音量和音高控制,并可将 stem 导出为音频和 MIDI 文件回到任意 DAW。Suno Studio 已在桌面端面向 Premier 用户开放。
Microsoft AI(MAI)发布两款自研模型:语音生成模型 MAI-Voice-1 已用于 Copilot Daily 和 Podcasts,并上线 Copilot Labs 体验。
推荐理由:Microsoft AI 官方公布两款自研模型的训练规模、使用入口与后续路线,读者可了解其自研模型布局。
Mistral AI 为 Le Chat 推出一批新功能,包括 Deep Research 预览模式、基于 Voxtral 的语音模式、由 Magistral 驱动的多语言推理、Projects 项目整理功能,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 官方一次性列出五项新功能及其支撑模型,读者可以对照了解 Le Chat 在研究和多模态方向的能力变化。
Mistral AI 发布语音理解模型 Voxtral,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API。
推荐理由:官方给出完整基准对比和定价细节,开源语音模型在准确率与成本上的位置可以直接对比判断。
Suno 发布一组创作控制功能:升级版 Song Editor 可在波形上逐段重排、改写和重制曲目,并可将曲目拆分为 12 条干净 stems(人声、鼓、贝斯等)预览和下载。音频上传扩展至最长 8 分钟,可从自己的完整曲目或吉他 riff 开始创作,另新增三个创意滑杆控制生成风格,支持导出后在 DAW 中继续编辑。
推荐理由:原文列出了 Song Editor、stems 分离和上传上限等具体能力,读者可以对照自己现有的创作流程判断是否用得上。
Suno 发布最新音乐生成模型 v4.5,曲风选项大幅扩充且更贴合描述,人声情感与音域增强,歌曲最长可达 8 分钟。新增提示词增强助手,Covers 与 Personas 可组合使用,生成速度与音频质量也有明显提升。
推荐理由:官方公告列出了 v4.5 在曲风、人声、音质和生成速度上的具体改进,音乐创作工作流的变化可以直接对照查看。
Suno 发布 v4 音乐生成模型,带来更干净的音频、更清晰的歌词和更有动态的歌曲结构。新功能包括 Remaster 旧曲目升级到 v4 音质、歌词辅助模型 ReMi 和封面生成,Covers 与 Personas 也已由 v4 驱动,目前以 beta 形式向 Pro 和 Premier 订阅开放,可在 suno.com 和 iOS 使用。
推荐理由:官方发布说明列出了音质、歌词、封面和功能升级点,读者可以据此判断是否升级使用。
Suno 发布新功能 Suno Scenes,将用户拍摄的照片和视频转化为歌曲,提供视觉叙事的歌曲创作方式。该功能先向 iOS 移动端用户开放,在应用的 Camera 模式下即可使用。
Suno 推出早期测试版新功能 Covers,可将语音备忘录或完整曲目转换成不同风格,同时保留原旋律。功能目前面向 Pro 和 Premier 订阅用户开放,每人有 200 次免费额度,之后每次生成消耗 10 credits;beta 阶段可能出现返回原片段未换风格等问题,官方征集用户反馈。
Suno 宣布推出移动 App,用户可用文字生成歌曲、用手机录音转成歌曲,并收听和收藏其他创作者的音乐。目前已有 1200 万人使用 Suno;该应用先在美国 iOS 上线,Android 和全球推广后续推出。
Suno 发布 Audio Input 功能,Pro 和 Premier 用户可上传或录制音频来生成歌曲。音频片段需在 6-60 秒之间,上传后可选择 Extend 设定时间戳、曲风和歌词;版权作品将被阻止上传,含人声的输入保持私密且不可搜索。
AI 音乐生成产品 Suno 宣布完成 1.25 亿美元融资,投资方包括 Lightspeed Venture Partners、Nat Friedman 和 Daniel Gross、Matrix 及 Founder Collective。Suno 上线八个月已有 1000 万人使用其产品创作音乐,资金将用于加速产品开发并扩充团队,官方表示未来几周将发布多项重大更新。
推荐理由:融资公告由创始团队自述,写明资金规模、投资方名单和用途,可了解这家 AI 音乐公司的最新进展。
Suno 发布 v3 模型,称其首个能生成广播级音乐的模型,已在 https://app.suno.ai 向所有用户开放。v3 可在几秒内生成完整两分钟歌曲,改进包括更好的音质、更多风格流派、更少幻觉和更自然的结尾。模型不识别艺术家引用,并采用不可闻水印技术检测 Suno 生成的歌曲,v4 已在开发中。
推荐理由:Suno 官方说明 v3 在音质、风格与提示词遵循上的具体改进,读者可据此对比自己此前的生成体验。