跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

当前仅显示精选新闻
93条精选相关主题多模态AI 视频产品更新

最新精选

第 81–93 条 · 共 93 条
11月25日周二
  1. Suno Blog69

    Suno 与 Warner Music Group 达成合作,推出授权音乐训练的新一代模型

    Suno 宣布与 Warner Music Group(WMG)达成新合作,将用高质量授权音乐训练新一代模型,称其将超越目前最好的 v5。WMG 艺人可自愿授权姓名、形象、声音和作品用于 AI 生成音乐并获得新收入;未来下载歌曲需付费账号,各付费档位含每月下载额度,Suno Studio 保持不变并保留无限下载。

    推荐理由:Suno 官方说明与 Warner Music Group 合作后的产品变化,包括付费下载门槛和授权模型计划,读者可据此调整使用方式。

11月19日周三
  1. Suno Blog60

    Suno 宣布完成 2.5 亿美元 C 轮融资,投后估值 24.5 亿美元

    Suno 宣布完成 2.5 亿美元 Series C 融资,投后估值 24.5 亿美元,由 Menlo Ventures 领投,NVentures(NVIDIA 风投部门)、Hallwood Media、Lightspeed 和 Matrix 参投。过去两年近 1 亿人在 Suno 上创作过音乐,公司称将用新资金为专业音乐人开发更复杂的工具、改善休闲创作者体验,并建设音乐社交与分享生态。

    推荐理由:官方公告给出融资金额、估值和投资方名单,并说明资金将投向专业工具与社交功能的扩展方向。

11月17日周一
  1. ElevenLabs Blog61

    ElevenLabs 推出 Image & Video(Beta),整合图像视频生成与语音制作

    ElevenLabs 发布 Image & Video(Beta),在单一平台内整合图像与视频生成能力。可使用 Veo、Sora、Kling、Wan、Seedance 等模型生成视频,用 Nanobanana、Flux Kontext、GPT Image、Seedream 生成图像,并支持放大和用 ElevenLabs 语音添加 lipsync。

    推荐理由:官方发布介绍了平台内聚合多家视频与图像模型并接续语音制作的完整流程,读者可以据此评估能否把现有分散的创作环节合并到一处。

8月29日周五
7月17日周四
  1. Mistral AI61

    Mistral AI 为 Le Chat 推出 Deep Research、语音、Projects 等多项新功能

    Mistral AI 为 Le Chat 推出一批新功能,包括 Deep Research 预览模式、基于 Voxtral 的语音模式、由 Magistral 驱动的多语言推理、Projects 项目整理功能,以及与 Black Forest Labs 合作的高级图像编辑。

    推荐理由:Mistral 官方一次性列出五项新功能及其支撑模型,读者可以对照了解 Le Chat 在研究和多模态方向的能力变化。

7月15日周二
6月3日周二
  1. Suno Blog68

    Suno 升级 Song Editor 并支持 8 分钟音频上传与 12 轨 stems 分离

    Suno 发布一组创作控制功能:升级版 Song Editor 可在波形上逐段重排、改写和重制曲目,并可将曲目拆分为 12 条干净 stems(人声、鼓、贝斯等)预览和下载。音频上传扩展至最长 8 分钟,可从自己的完整曲目或吉他 riff 开始创作,另新增三个创意滑杆控制生成风格,支持导出后在 DAW 中继续编辑。

    推荐理由:原文列出了 Song Editor、stems 分离和上传上限等具体能力,读者可以对照自己现有的创作流程判断是否用得上。

5月1日周四
  1. Suno Blog64

    Suno 发布 v4.5 音乐生成模型

    Suno 发布最新音乐生成模型 v4.5,曲风选项大幅扩充且更贴合描述,人声情感与音域增强,歌曲最长可达 8 分钟。新增提示词增强助手,Covers 与 Personas 可组合使用,生成速度与音频质量也有明显提升。

    推荐理由:官方公告列出了 v4.5 在曲风、人声、音质和生成速度上的具体改进,音乐创作工作流的变化可以直接对照查看。

1月24日周五
  1. FireRedTeam GitHub 新仓库61

    FireRedTeam 开源 FireRedASR 工业级中文语音识别模型,含 LLM 与 AED 两个变体

    FireRedTeam 开源工业级语音识别模型 FireRedASR,支持普通话、中文方言和英语,含 8.3B 的 FireRedASR-LLM(Encoder-Adapter-LLM 架构)和 1.1B 的 FireRedASR-AED 两个变体。

    推荐理由:仓库给出两个变体的公开基准 CER/WER 对比数字和使用限制,读者可以据此评估它在中文语音识别里的可用性。

11月19日周二
  1. Suno Blog61

    Suno 发布 v4 音乐生成模型

    Suno 发布 v4 音乐生成模型,带来更干净的音频、更清晰的歌词和更有动态的歌曲结构。新功能包括 Remaster 旧曲目升级到 v4 音质、歌词辅助模型 ReMi 和封面生成,Covers 与 Personas 也已由 v4 驱动,目前以 beta 形式向 Pro 和 Premier 订阅开放,可在 suno.com 和 iOS 使用。

    推荐理由:官方发布说明列出了音质、歌词、封面和功能升级点,读者可以据此判断是否升级使用。

5月21日周二
  1. Suno Blog62

    Suno 宣布融资 1.25 亿美元

    AI 音乐生成产品 Suno 宣布完成 1.25 亿美元融资,投资方包括 Lightspeed Venture Partners、Nat Friedman 和 Daniel Gross、Matrix 及 Founder Collective。Suno 上线八个月已有 1000 万人使用其产品创作音乐,资金将用于加速产品开发并扩充团队,官方表示未来几周将发布多项重大更新。

    推荐理由:融资公告由创始团队自述,写明资金规模、投资方名单和用途,可了解这家 AI 音乐公司的最新进展。

5月14日周二
  1. Sam Altman Blog86

    Sam Altman 谈 GPT-4o 免费开放与全新语音模式

    Sam Altman 发文强调 GPT-4o 已免费向 ChatGPT 用户开放,且无广告,呼应其让强大 AI 工具普惠的使命。他称新的语音和视频模式是他用过的最好计算机界面,达到人类水平的响应时间和表现力,体验自然流畅,并展望未来加入可选个性化、访问个人信息和代用户执行操作等能力。

    推荐理由:作者本人解释免费开放 GPT-4o 的考量,并给出新语音模式的第一手使用感受,可作官方视角的背景补充。

3月21日周四
  1. Suno Blog84

    Suno 发布 v3 模型,可生成广播级两分钟完整歌曲

    Suno 发布 v3 模型,称其首个能生成广播级音乐的模型,已在 https://app.suno.ai 向所有用户开放。v3 可在几秒内生成完整两分钟歌曲,改进包括更好的音质、更多风格流派、更少幻觉和更自然的结尾。模型不识别艺术家引用,并采用不可闻水印技术检测 Suno 生成的歌曲,v4 已在开发中。

    推荐理由:Suno 官方说明 v3 在音质、风格与提示词遵循上的具体改进,读者可据此对比自己此前的生成体验。