跳到正文

#语音

今日 12 条
9月22日周二
  1. Suno Blog31

    Suno 解析:压缩器到底在做什么?

    压缩器通过降低音频中最响部分的音量、再用补偿增益提升整体电平,从而缩小动态范围,让安静细节在混音中更清晰。Suno Studio 的压缩器插件提供阈值、压缩比、启动与释放等参数,并配有实时动态曲线表,适合处理上传或录制的原始音频。Studio 为浏览器端 DAW,随 Suno Premier 订阅免费提供。

9月19日周六
9月17日周四
  1. Greg Brockman31

    Codex voice for road trips:

    引用Jonathan Roomer@jonathanroomer

    I’ve got Codex (voice) in CarPlay. And it’s fantastic. I can now build things during road trips, while all 5 kids make a noise and my wife asks why I talk to the AI more than I talk to her. It runs through my Nightblood iOS app, which gives ChatGPT Voice a face, personality and full access to Codex, my Mac and all the native tools.

9月16日周三
  1. Google Blog: AI64

    Google 公布多语言 AI 进展:Gemini 3.5 Live Translate 支持 70 种语言实时口译,TranslateGemma 可离线运行

    Google 宣布其语言技术已覆盖 300 多种语言、服务超 70 亿人,占全球人口 86%。Gemini 3.5 Live Translate 支持 70 种语言。

    推荐理由:官方梳理了从实时翻译到无障碍设计的语言 AI 布局,并给出各产品的覆盖语言数和合作项目,可作了解现状的参考。

9月11日周五
9月10日周四
  1. OpenAI News70

    OpenAI 在 API 中推出语音模型 GPT‑Live‑1

    OpenAI 在 API 中推出语音模型 GPT‑Live‑1,支持自然的全双工语音对话。模型具备更强的指令遵循能力,支持自定义音色和电话场景。

    推荐理由:官方摘要指出模型新增全双工语音、自定义音色和电话支持,可据此了解 API 语音能力的扩展方向。

9月9日周三
9月8日周二
9月3日周四
8月27日周四
  1. Google DeepMind65

    Google DeepMind 发布语音转写模型 Gemini 3.5 Transcribe

    Google DeepMind 推出语音转文字模型 Gemini 3.5 Transcribe,定位为更精确的实时转写模型,已在 Gemini API(Google AI Studio 和 Gemini Enterprise Agent Platform)开启公开预览。

    推荐理由:官方给出了两个 API 入口、WER 数字和与 Chirp 3 的对比,读者可据此评估其语音转写与语音交互场景的可用性。

8月24日周一
8月21日周五
8月13日周四
  1. Suno Blog65

    Suno Studio 2.0 发布,面向 Premier 订阅者新增 MIDI 编辑与自动化等功能

    Suno 发布 Studio 2.0,现向 Premier 订阅者开放。新增时间线 MIDI 导入、录制与编辑,可用 MIDI 剪辑作为生成提示词,附带新的 wavetable 合成器;另推出 Chat bar(beta)协作创作、高级 stem 分离、音频效果与自定义插件、自动化曲线,并支持无损导出 32-bit/48kHz 多轨与 stems。插件创建目前不消耗 credits。

    推荐理由:官方发布新增 MIDI、Chat bar、自动化等能力,音乐创作者可据此判断 Suno Studio 2.0 是否融入现有工作流。

8月12日周三
  1. Suno Blog67

    Suno 宣布与 BMG 达成全球合作

    Suno 官方宣布与大型音乐公司 BMG 达成全球合作伙伴关系,该合作是 Suno 即将推出的首个与音乐行业共同开发的音乐模型的一部分。双方将共同打造连接艺术家与粉丝的新体验,并为选择加入的艺术家和词曲作者创造新的经济机会,同时深化 Suno: In Session 和 Spark 等对独立艺术家的支持项目。

    推荐理由:Suno 官方宣布与 BMG 达成全球合作,说明合作将伴随其首个与音乐行业共同开发的音乐模型推出,可据此了解 AI 音乐公司与版权方的合作模式。

8月11日周二
  1. Sierra Blog54

    Sierra 为智能体推出开箱即用的 IVR 电话导航能力

    Sierra 推出开箱即用的 IVR 导航能力,让智能体能打电话穿越多级菜单、判断何时沉默、发送 DTMF 按键音并识别真人接听。评测显示开启该功能后整体通过率提升 49%,从 57% 到 85%,其中「联系到人」类任务提升最大;客户包括一家 top 5 医疗支付方和一家全国性数字药房。

8月10日周一
  1. Suno Blog64

    Suno 更新下载政策与服务条款,9月3日起实施下载限额

    Suno 官宣 9 月 3 日起按订阅档位实施下载限额,Free 用户终身仅 7 次试用下载,Pro 每月 20 次,Premier 每月 60 次,Suno Studio 无下载限制,超出部分可购买。同时推出新服务条款,付费计划下载的歌曲保留商用权,此前所有歌曲仍可播放和分享;新一代 Suno 模型即将上线,发布时旧模型将全部退役。

    推荐理由:官方说明给出各档下载限额、免费用户终身额度等关键细节,对现有用户判断订阅与商用权利有直接参考价值。

8月8日周六
  1. Sierra Blog45

    Sierra 推出 Voice Personas:为 AI 智能体打造品牌专属语音人格

    Sierra 发布 Voice Personas,让企业为同一个 AI 智能体配置不同语音人格,可跨品牌、市场与语言复用同一底层智能体。该功能结合语音、个性与语言感知行为,支持智能体在对话中调整语速、应对打断并切换语音或语言,由多种语音模型按场景择优驱动。Sierra 称某智能体搭配自然语音与人格后解决率提升近 50%,Voice Personas 现已上线。

7月24日周五
7月22日周三
7月15日周三
7月9日周四
7月1日周三
6月17日周三
6月11日周四
  1. Suno Blog52

    Suno 更新 Stem Separation:新增三种拆分模式

    Suno 更新 Stem Separation 功能,提供 Auto Split(最多拆出 12 个 stems)、Split from Mix 和仅限 Premier 的 Advanced Split 三种模式。Advanced Split 可从近 100 种乐器中精确提取;Suno 采用重新生成每个 stem 而非切割混音的做法。该功能适用于平台创作及上传的音乐,需付费订阅。

6月9日周二
6月5日周五
6月3日周三
  1. Microsoft AI News61

    Microsoft 发布 MAI-Voice-2 文本转语音模型

    Microsoft 发布文本转语音模型 MAI-Voice-2,在保真度、语言覆盖、说话人一致性和情感范围上较前代显著提升。支持语言从英语扩展到 15 种,提供情感标签细粒度控制,可用 5-60 秒参考音频零样本创建自定义声音,且生产环境仅允许授权声音合成。

    推荐理由:官方发布给出语言扩展、零样本克隆与偏好测试数据,读者可据此评估该语音模型在生产场景中的可用性。

6月2日周二
  1. Microsoft AI News49

    微软发布 MAI-Transcribe-1.5,新增关键词偏置功能

    微软推出转录模型 MAI-Transcribe-1.5,新增关键词偏置功能,可让用户提供领域特定关键词列表来引导预测,模型会结合上下文判断是否应用偏置而非盲目强制匹配。在 FLEURS 多语言基准上,启用关键词偏置后词错误率(WER)降低 30%,在提升专业词汇识别的同时保持通用语音的准确率。

5月19日周二
  1. Sierra Blog34

    Sierra 详解语音 AI 转录平台:多提供商集成与上下文感知如何降低错误率

    Sierra 构建了一套语音转录平台,通过并行调用多个转录提供商进行集成、注入对话上下文,并支持 70+ 种语言,以解决姓名拼写歧义、行业术语识别等难题。其内部基准显示,集成方案平均将话语错误率降低约 25%,在部分语言中最高降低 37%;上下文感知转录使金融服务智能体的输入验证率提升超 25%,整体问题解决率最高提升 1%,重大转录错误减少最多 15%。

5月4日周一
  1. Runway News66

    Runway 发布 Characters,单张图片生成 24fps 实时对话视频智能体

    Runway 发布 Characters,基于 GWM-1 将单张参考图转为可实时对话的视频角色,无需微调,支持写实人像、卡通和吉祥物等风格。模型每帧有效耗时 37 毫秒,用户停止说话到角色开口的服务端延迟 1.75 秒;通过扩散变换器与 VAE 解码器流水线并行、KV-cache 管理、CUDA Graphs 和 Triton 核优化实现 24fps 实时生成。

    推荐理由:官方技术博客拆解了实时管线的关键数字和系统优化,读者可以据此理解单图驱动的对话视频智能体的实现路径。