跳到正文

#语音

今日 12 条
5月2日周六
  1. Sierra Blog64

    Sierra 发布 𝜏-voice 基准,在真实语音条件下评测实时语音 Agent

    Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。

    推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。

4月21日周二
4月16日周四
4月2日周四
3月26日周四
  1. Suno Blog66

    Suno 发布 v5.5 模型,推出 Voices、Custom models 和 My Taste 个性化功能

    Suno 发布 v5.5 模型,同时推出三项个性化功能。Voices 让用户采集自己的声音来创作音乐,包含验证流程且默认私密,面向 Pro 和 Premier 订阅者;Custom models 可基于自有曲目调出个性化模型,最多可建三个;My Taste 根据用户偏好学习风格,面向所有用户。官方称这些能力为今年晚些时候与音乐行业合作推出的新一代音乐模型打基础。

    推荐理由:原文交代了新功能的具体机制与订阅限制,读者可据此判断如何用自己的声音和风格来创作音乐。

3月24日周二
  1. Mistral AI66

    Mistral AI 发布首个语音合成模型 Voxtral TTS

    Mistral AI 发布 4B 参数的文本转语音模型 Voxtral TTS,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,API 定价 $0.016 per 1k characters。

    推荐理由:官方给出了与 ElevenLabs 对比的人类评测数据和低延迟指标,读者可据此评估其在语音 Agent 场景的可用性。

3月19日周四
2月6日周五
2月5日周四
  1. Mistral AI64

    Mistral 发布 Voxtral Transcribe 2 语音转写模型,Realtime 开放权重

    Mistral 发布 Voxtral Transcribe 2 系列,包含 Voxtral Mini Transcribe V2(批量转写)和 Voxtral Realtime(实时转写),支持 13 种语言的说话人分离、上下文偏置和词级时间戳。

    推荐理由:官方给出了两个语音转写模型的具体延迟、错误率和价格,并开放了 Voxtral Realtime 权重,便于按场景选型。

11月25日周二
  1. Suno Blog69

    Suno 与 Warner Music Group 达成合作,推出授权音乐训练的新一代模型

    Suno 宣布与 Warner Music Group(WMG)达成新合作,将用高质量授权音乐训练新一代模型,称其将超越目前最好的 v5。WMG 艺人可自愿授权姓名、形象、声音和作品用于 AI 生成音乐并获得新收入;未来下载歌曲需付费账号,各付费档位含每月下载额度,Suno Studio 保持不变并保留无限下载。

    推荐理由:Suno 官方说明与 Warner Music Group 合作后的产品变化,包括付费下载门槛和授权模型计划,读者可据此调整使用方式。

11月19日周三
  1. Suno Blog60

    Suno 宣布完成 2.5 亿美元 C 轮融资,投后估值 24.5 亿美元

    Suno 宣布完成 2.5 亿美元 Series C 融资,投后估值 24.5 亿美元,由 Menlo Ventures 领投,NVentures(NVIDIA 风投部门)、Hallwood Media、Lightspeed 和 Matrix 参投。过去两年近 1 亿人在 Suno 上创作过音乐,公司称将用新资金为专业音乐人开发更复杂的工具、改善休闲创作者体验,并建设音乐社交与分享生态。

    推荐理由:官方公告给出融资金额、估值和投资方名单,并说明资金将投向专业工具与社交功能的扩展方向。

9月25日周四
  1. Suno Blog57

    Suno 发布生成式音频工作站 Suno Studio

    Suno 宣布推出 Suno Studio,定位为生成式音频工作站,将 AI 生成融入音乐创作流程。它支持即时生成人声、鼓、合成器等无限 stem 变体,提供多轨时间线编辑、BPM、音量和音高控制,并可将 stem 导出为音频和 MIDI 文件回到任意 DAW。Suno Studio 已在桌面端面向 Premier 用户开放。

8月29日周五
7月17日周四
  1. Mistral AI61

    Mistral AI 为 Le Chat 推出 Deep Research、语音、Projects 等多项新功能

    Mistral AI 为 Le Chat 推出一批新功能,包括 Deep Research 预览模式、基于 Voxtral 的语音模式、由 Magistral 驱动的多语言推理、Projects 项目整理功能,以及与 Black Forest Labs 合作的高级图像编辑。

    推荐理由:Mistral 官方一次性列出五项新功能及其支撑模型,读者可以对照了解 Le Chat 在研究和多模态方向的能力变化。

7月15日周二
6月3日周二
  1. Suno Blog68

    Suno 升级 Song Editor 并支持 8 分钟音频上传与 12 轨 stems 分离

    Suno 发布一组创作控制功能:升级版 Song Editor 可在波形上逐段重排、改写和重制曲目,并可将曲目拆分为 12 条干净 stems(人声、鼓、贝斯等)预览和下载。音频上传扩展至最长 8 分钟,可从自己的完整曲目或吉他 riff 开始创作,另新增三个创意滑杆控制生成风格,支持导出后在 DAW 中继续编辑。

    推荐理由:原文列出了 Song Editor、stems 分离和上传上限等具体能力,读者可以对照自己现有的创作流程判断是否用得上。

5月1日周四
  1. Suno Blog64

    Suno 发布 v4.5 音乐生成模型

    Suno 发布最新音乐生成模型 v4.5,曲风选项大幅扩充且更贴合描述,人声情感与音域增强,歌曲最长可达 8 分钟。新增提示词增强助手,Covers 与 Personas 可组合使用,生成速度与音频质量也有明显提升。

    推荐理由:官方公告列出了 v4.5 在曲风、人声、音质和生成速度上的具体改进,音乐创作工作流的变化可以直接对照查看。

11月19日周二
  1. Suno Blog61

    Suno 发布 v4 音乐生成模型

    Suno 发布 v4 音乐生成模型,带来更干净的音频、更清晰的歌词和更有动态的歌曲结构。新功能包括 Remaster 旧曲目升级到 v4 音质、歌词辅助模型 ReMi 和封面生成,Covers 与 Personas 也已由 v4 驱动,目前以 beta 形式向 Pro 和 Premier 订阅开放,可在 suno.com 和 iOS 使用。

    推荐理由:官方发布说明列出了音质、歌词、封面和功能升级点,读者可以据此判断是否升级使用。

10月16日周三
9月12日周四
7月1日周一
6月12日周三
5月21日周二
  1. Suno Blog62

    Suno 宣布融资 1.25 亿美元

    AI 音乐生成产品 Suno 宣布完成 1.25 亿美元融资,投资方包括 Lightspeed Venture Partners、Nat Friedman 和 Daniel Gross、Matrix 及 Founder Collective。Suno 上线八个月已有 1000 万人使用其产品创作音乐,资金将用于加速产品开发并扩充团队,官方表示未来几周将发布多项重大更新。

    推荐理由:融资公告由创始团队自述,写明资金规模、投资方名单和用途,可了解这家 AI 音乐公司的最新进展。

3月21日周四
  1. Suno Blog84

    Suno 发布 v3 模型,可生成广播级两分钟完整歌曲

    Suno 发布 v3 模型,称其首个能生成广播级音乐的模型,已在 https://app.suno.ai 向所有用户开放。v3 可在几秒内生成完整两分钟歌曲,改进包括更好的音质、更多风格流派、更少幻觉和更自然的结尾。模型不识别艺术家引用,并采用不可闻水印技术检测 Suno 生成的歌曲,v4 已在开发中。

    推荐理由:Suno 官方说明 v3 在音质、风格与提示词遵循上的具体改进,读者可据此对比自己此前的生成体验。