跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

当前仅显示精选新闻
83条精选相关主题多模态AI 视频产品更新

最新精选

第 21–40 条 · 共 83 条
9月9日周三
9月5日周六
8月28日周五
8月27日周四
  1. @rohanpaul_ai69

    Google 发布 Gemini 3.5 Transcribe,一款不再逐字记录、而是输出用户本意的语音转写模型,现已通过 API 开放。

    原始视频预览图;未保存可播放视频URL原始视频预览图;未保存可播放视频URL原始视频预览图;未保存可播放视频URL
    引用@sundarpichai@sundarpichai

    Say hello to Gemini 3.5 Transcribe! - Build apps that understand user speech / intent, even w/ multiple speakers! - Auto-detection of 85+ languages out of the box - Custom vocab adaptation for specialized jargon... SGTM:) API available now in @GoogleAIStudio and Gemini Enterprise, or try it in the Gemini app on macOS or Rambler on Android! More details: https://t.co/AduutCb3M7

    推荐理由:原文列出两个 API 端点各自的能力与时长限制,读者可据此判断语音转写在工作流中的可用边界。

8月22日周六
8月21日周五
8月17日周一
  1. xAI News71

    xAI 发布 Grok Voice Agent API

    xAI 发布 Grok Voice Agent API,开发者可用它构建支持数十种语言、调用工具并实时搜索数据的语音智能体。该 API 按每分钟 0.05 美元的固定费率计费,平均首音频延迟低于 1 秒,在 Big Bench Audio 排名第一。

    推荐理由:xAI 把已在特斯拉和移动端使用的语音栈开放为 API,开发者可据此评估自建语音智能体的延迟与成本。

  2. xAI News64

    xAI 发布语音模型 Grok Voice Think Fast 2.0

    xAI 发布新一代语音模型 Grok Voice Think Fast 2.0,称其在语音推理、转录准确率和对话能力上较 1.0 有明显提升。该模型在 Artificial Analysis 语音到语音质量指数上为 82.9%,首字延迟 0.70s,转录准确率相对 Deepgram Nova 3 与 ElevenLabs Scribe v2 提升 1.5–2.0 倍。

    推荐理由:相比 1.0 与 GPT-Realtime-2.1,原文给出了语音质量、推理效率与首字延迟的对比数据,可供语音智能体选型参考。

8月13日周四
  1. FireRedTeam GitHub 新仓库64

    FireRedTeam 开源 FireRedTTS3 语音生成与编辑模型,支持 24 种语言和 21 种中文方言

    FireRedTeam 发布 FireRedTTS3 的 PyTorch 代码与模型,基于语义增强连续语音表示,统一语音生成与编辑,含 Base 和 Instruct 两个变体,采用 Apache-2.0 许可。

    推荐理由:仓库给出完整评测数字和安装使用入口,读者可以据此评估它在多语言克隆和语音编辑上的实际表现。

  2. Suno Blog65

    Suno Studio 2.0 发布,面向 Premier 订阅者新增 MIDI 编辑与自动化等功能

    Suno 发布 Studio 2.0,现向 Premier 订阅者开放。新增时间线 MIDI 导入、录制与编辑,可用 MIDI 剪辑作为生成提示词,附带新的 wavetable 合成器;另推出 Chat bar(beta)协作创作、高级 stem 分离、音频效果与自定义插件、自动化曲线,并支持无损导出 32-bit/48kHz 多轨与 stems。插件创建目前不消耗 credits。

    推荐理由:官方发布新增 MIDI、Chat bar、自动化等能力,音乐创作者可据此判断 Suno Studio 2.0 是否融入现有工作流。

8月12日周三
  1. Suno Blog67

    Suno 宣布与 BMG 达成全球合作

    Suno 官方宣布与大型音乐公司 BMG 达成全球合作伙伴关系,该合作是 Suno 即将推出的首个与音乐行业共同开发的音乐模型的一部分。双方将共同打造连接艺术家与粉丝的新体验,并为选择加入的艺术家和词曲作者创造新的经济机会,同时深化 Suno: In Session 和 Spark 等对独立艺术家的支持项目。

    推荐理由:Suno 官方宣布与 BMG 达成全球合作,说明合作将伴随其首个与音乐行业共同开发的音乐模型推出,可据此了解 AI 音乐公司与版权方的合作模式。

8月10日周一
  1. Suno Blog64

    Suno 更新下载政策与服务条款,9月3日起实施下载限额

    Suno 官宣 9 月 3 日起按订阅档位实施下载限额,Free 用户终身仅 7 次试用下载,Pro 每月 20 次,Premier 每月 60 次,Suno Studio 无下载限制,超出部分可购买。同时推出新服务条款,付费计划下载的歌曲保留商用权,此前所有歌曲仍可播放和分享;新一代 Suno 模型即将上线,发布时旧模型将全部退役。

    推荐理由:官方说明给出各档下载限额、免费用户终身额度等关键细节,对现有用户判断订阅与商用权利有直接参考价值。

8月5日周三
  1. ByteDance Seed Research68

    字节 Seed 发布音视频全双工大模型 SeedRealtime 并在豆包 App 全量上线

    ByteDance Seed 发布原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,支持音视频联合理解、主动交互与流畅对话节奏。端到端人工评测显示,相比级联模型,音视频对话节奏问题减少一半。模型已在豆包 App 全量上线,用户更新后在对话框选择“打电话”进入视频通话即可体验。

    推荐理由:原文给出统一架构、端到端评测数字和豆包 App 开放入口,可据此了解音视频全双工交互的能力与体验变化。

7月24日周五
7月23日周四