#语音
#语音
今日 12 条
OpenBMB@OpenBMBAI 评分5858
Suno BlogAI 评分3131 Suno 解析:压缩器到底在做什么?
压缩器通过降低音频中最响部分的音量、再用补偿增益提升整体电平,从而缩小动态范围,让安静细节在混音中更清晰。Suno Studio 的压缩器插件提供阈值、压缩比、启动与释放等参数,并配有实时动态曲线表,适合处理上传或录制的原始音频。Studio 为浏览器端 DAW,随 Suno Premier 订阅免费提供。
Google AI@GoogleAIAI 评分3737
SpaceXAI@SpaceXAIAI 评分3535推出 Grok Voice Transcribe 2.0。它是全球最准确的语音转写模型。

Greg Brockman@gdbAI 评分3131引用Jonathan Roomer@jonathanroomerI’ve got Codex (voice) in CarPlay. And it’s fantastic. I can now build things during road trips, while all 5 kids make a noise and my wife asks why I talk to the AI more than I talk to her. It runs through my Nightblood iOS app, which gives ChatGPT Voice a face, personality and full access to Codex, my Mac and all the native tools.
Logan Kilpatrick@OfficialLoganKAI 评分6464



Google AI@GoogleAI精选AI 评分7474Google AI 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音模型。

推荐理由:原文分述两款语音模型的能力差异与使用场景,读者可据此判断选型方向。
Google DeepMind精选AI 评分7171 Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型
Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两个实时语音对话模型,主打近实时推理与语音智能体。
推荐理由:官方给出两个新语音模型的定位分工和多项基准数字,读者可据此判断其适合规模化还是高复杂度语音任务。
Google Blog: AI精选AI 评分6464 Google 公布多语言 AI 进展:Gemini 3.5 Live Translate 支持 70 种语言实时口译,TranslateGemma 可离线运行
Google 宣布其语言技术已覆盖 300 多种语言、服务超 70 亿人,占全球人口 86%。Gemini 3.5 Live Translate 支持 70 种语言。
推荐理由:官方梳理了从实时翻译到无障碍设计的语言 AI 布局,并给出各产品的覆盖语言数和合作项目,可作了解现状的参考。
OpenRouter AnnouncementsAI 评分5353 OpenRouter 文本转语音教程:一个 API 端点调用多家 TTS 模型
OpenRouter 通过 OpenAI 兼容的 POST /api/v1/audio/speech 端点提供文本转语音,一个 API key 即可以相同请求结构调用 Mistral Voxtral Mini TTS、xAI Grok Voice TTS 1.0、Microsoft MAI-Voice-2 等多家模型。
OpenAI News精选AI 评分7070 OpenAI 在 API 中推出语音模型 GPT‑Live‑1
OpenAI 在 API 中推出语音模型 GPT‑Live‑1,支持自然的全双工语音对话。模型具备更强的指令遵循能力,支持自定义音色和电话场景。
推荐理由:官方摘要指出模型新增全双工语音、自定义音色和电话支持,可据此了解 API 语音能力的扩展方向。
Google Gemini@GeminiAppAI 评分2626
Suno Blog精选AI 评分6868 Suno 发布 v6 下一代音乐模型,推出 v6、v6-wild、v6-mini 三档
Suno 发布 v6 新一代音乐模型,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,并最终以下一代模型替换旧模型。
推荐理由:原文由官方给出三档模型分工与具体编辑能力示例,读者可以据此判断新工作流是否适合自己。
Suno BlogAI 评分5656 Suno 宣布与 Believe 和 TuneCore 达成全球战略合作
Suno 宣布与 Believe 和 TuneCore 达成全球战略合作,使用 Suno 新行业伙伴模型创作的歌曲可通过 Believe 和 TuneCore 分发。
Microsoft AI NewsAI 评分5757 Microsoft MAI 发布语音识别模型 MAI-Transcribe-2
Microsoft MAI 发布转写模型 MAI-Transcribe-2,在 FLEURS 基准 60 种语言上以平均词错率 5.2% 排名第一,定价每小时音频 $0.10(年底前限时)。
Ammaar Reshi@ammaarAI 评分6060
Google AI Developers@googleaidevsAI 评分4747
Google DeepMind精选AI 评分6565 Google DeepMind 发布语音转写模型 Gemini 3.5 Transcribe
Google DeepMind 推出语音转文字模型 Gemini 3.5 Transcribe,定位为更精确的实时转写模型,已在 Gemini API(Google AI Studio 和 Gemini Enterprise Agent Platform)开启公开预览。
推荐理由:官方给出了两个 API 入口、WER 数字和与 Chirp 3 的对比,读者可据此评估其语音转写与语音交互场景的可用性。
SpaceXAI@SpaceXAIAI 评分3535在 LiveKit 中使用 Grok Voice 模型,构建实用的语音智能体,全面支持 ZDR
引用LiveKit@livekitWe built a patient intake agent with @SpaceXAI that runs end to end on Grok voice models. Grok STT → Grok 4.3 → Grok TTS, cascaded through LiveKit Inference. Three model strings in one AgentSession. No separate API key, no separate billing, ZDR on every hop. Talk to it: https://xai.livekit.space
Google Developers BlogAI 评分5555 Google ADK 实测教程:如何评测实时语音 Agent
Google 在 ADK 中推出原生实时(live)评测能力,可用模拟用户以音频形式与语音 Agent 对话并对口头回复打分。
Hugging Face Blog精选AI 评分6262 Hugging Face 用三项测试量化语音识别中的基准优化现象
Hugging Face 提出三项测试量化 ASR 模型的基准优化(benchmaxxing)行为,评估 11 个开源模型后发现多个高分模型会复现 VoxPopuli 和 LibriSpeech 的错误参考转写。
推荐理由:原文给出三种可量化的探针方法,让读者能据此区分语音模型的真实转写能力与针对基准的拟合行为。
Suno Blog精选AI 评分6565 Suno Studio 2.0 发布,面向 Premier 订阅者新增 MIDI 编辑与自动化等功能
Suno 发布 Studio 2.0,现向 Premier 订阅者开放。新增时间线 MIDI 导入、录制与编辑,可用 MIDI 剪辑作为生成提示词,附带新的 wavetable 合成器;另推出 Chat bar(beta)协作创作、高级 stem 分离、音频效果与自定义插件、自动化曲线,并支持无损导出 32-bit/48kHz 多轨与 stems。插件创建目前不消耗 credits。
推荐理由:官方发布新增 MIDI、Chat bar、自动化等能力,音乐创作者可据此判断 Suno Studio 2.0 是否融入现有工作流。
Suno Blog精选AI 评分6767 Suno 宣布与 BMG 达成全球合作
Suno 官方宣布与大型音乐公司 BMG 达成全球合作伙伴关系,该合作是 Suno 即将推出的首个与音乐行业共同开发的音乐模型的一部分。双方将共同打造连接艺术家与粉丝的新体验,并为选择加入的艺术家和词曲作者创造新的经济机会,同时深化 Suno: In Session 和 Spark 等对独立艺术家的支持项目。
推荐理由:Suno 官方宣布与 BMG 达成全球合作,说明合作将伴随其首个与音乐行业共同开发的音乐模型推出,可据此了解 AI 音乐公司与版权方的合作模式。
Sierra BlogAI 评分5454 Sierra 为智能体推出开箱即用的 IVR 电话导航能力
Sierra 推出开箱即用的 IVR 导航能力,让智能体能打电话穿越多级菜单、判断何时沉默、发送 DTMF 按键音并识别真人接听。评测显示开启该功能后整体通过率提升 49%,从 57% 到 85%,其中「联系到人」类任务提升最大;客户包括一家 top 5 医疗支付方和一家全国性数字药房。
Suno Blog精选AI 评分6464 Suno 更新下载政策与服务条款,9月3日起实施下载限额
Suno 官宣 9 月 3 日起按订阅档位实施下载限额,Free 用户终身仅 7 次试用下载,Pro 每月 20 次,Premier 每月 60 次,Suno Studio 无下载限制,超出部分可购买。同时推出新服务条款,付费计划下载的歌曲保留商用权,此前所有歌曲仍可播放和分享;新一代 Suno 模型即将上线,发布时旧模型将全部退役。
推荐理由:官方说明给出各档下载限额、免费用户终身额度等关键细节,对现有用户判断订阅与商用权利有直接参考价值。
Sierra BlogAI 评分4545 Sierra 推出 Voice Personas:为 AI 智能体打造品牌专属语音人格
Sierra 发布 Voice Personas,让企业为同一个 AI 智能体配置不同语音人格,可跨品牌、市场与语言复用同一底层智能体。该功能结合语音、个性与语言感知行为,支持智能体在对话中调整语速、应对打断并切换语音或语言,由多种语音模型按场景择优驱动。Sierra 称某智能体搭配自然语音与人格后解决率提升近 50%,Voice Personas 现已上线。
Microsoft AI News精选AI 评分6262 Microsoft AI 发布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash 公开预览版
Microsoft AI 发布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash,两款模型均进入公开预览。
推荐理由:原文给出两款新模型的定价、性能数字和产品落地情况,可据此比较其质量速度成本取舍。
OpenRouter Announcements精选AI 评分6767 OpenRouter 推出音频转写端点 /api/v1/audio/transcriptions
OpenRouter 上线 POST /api/v1/audio/transcriptions 音频转写端点,复用 Chat Completions 的同一 API key 和鉴权。
推荐理由:官方教程给出了完整的请求参数、限制和计费细节,读者可以直接照抄接入而不必自建 Whisper 服务。
Hugging Face BlogAI 评分5050 Hugging Face 发布 Real World VoiceEQ 基准,用人类评分衡量语音 AI 的人类化质量
Hugging Face 团队推出 Real World VoiceEQ 基准,评估语音交互的人类化质量,覆盖 40 多个专有和开源语音模型、15+ 维度和 60 多项指标,涉及 ASR、TTS、S2S 和语音理解。
Microsoft AI NewsAI 评分3939 微软 MAI 音频模型驱动 Ode Poetry:用 AI 复刻诗人声音推荐诗歌
微软 AI 与诗歌推广人 William Sieghart、创意工作室 Gravity Road 合作推出数字诗歌体验 Ode Poetry,基于 MAI 音频模型实现实时对话与诗歌推荐。
Hugging Face BlogAI 评分5656 Hugging Face 与 Cerebras 基于 Gemma 4 打造实时语音到语音演示
Hugging Face 与 Cerebras 展示了一套全开源、模块化可替换的实时语音到语音流水线,语言模型采用 Google DeepMind 的 Gemma 4 31B,在 Cerebras 上推理,语音识别用 Nvidia Parakeet,语音合成用 Alibaba Qwen3TTS。
LMSYS BlogAI 评分5858 SGLang-Omni 上线 MOSS-TTS-Local-Transformer-v1.5 端到端推理服务
LMSYS、MOSI 与 OpenMOSS 团队宣布在 SGLang-Omni 上实现 MOSS-TTS-Local-Transformer-v1.5 的端到端服务,该开源 TTS 模型支持 48 kHz 立体声、零样本音色克隆、31 种语言和最长 10 分钟生成。
Suno BlogAI 评分5252 Suno 更新 Stem Separation:新增三种拆分模式
Suno 更新 Stem Separation 功能,提供 Auto Split(最多拆出 12 个 stems)、Split from Mix 和仅限 Premier 的 Advanced Split 三种模式。Advanced Split 可从近 100 种乐器中精确提取;Suno 采用重新生成每个 stem 而非切割混音的做法。该功能适用于平台创作及上传的音乐,需付费订阅。
Google DeepMind精选AI 评分7979 Google DeepMind 发布 Gemini 3.5 Live Translate 语音翻译模型
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70+ 语言近实时语音到语音翻译,自动检测语言并保留说话者的语调、节奏和音高,全程仅落后说话者几秒。
推荐理由:原文给出模型能力、开放渠道和 Meet 语言扩展细节,读者可据此评估它在会议和翻译场景的可用性。
Suno BlogAI 评分4545 Suno Voices 使用指南:6 个技巧打造更具表现力的人声
Suno 发布 Voices 功能使用指南,给出 6 个提升人声表现力的技巧:在安静环境录制、提前练习、不必追求完美、尽量录长(建议至少 1 分钟)、让声音匹配曲风、大胆尝试意外风格。Voices 已在 Web、iOS 和 Android 上线,可免费试用,付费方案提供更多功能。
Microsoft AI News精选AI 评分6161 Microsoft 发布 MAI-Voice-2 文本转语音模型
Microsoft 发布文本转语音模型 MAI-Voice-2,在保真度、语言覆盖、说话人一致性和情感范围上较前代显著提升。支持语言从英语扩展到 15 种,提供情感标签细粒度控制,可用 5-60 秒参考音频零样本创建自定义声音,且生产环境仅允许授权声音合成。
推荐理由:官方发布给出语言扩展、零样本克隆与偏好测试数据,读者可据此评估该语音模型在生产场景中的可用性。
Microsoft AI News精选AI 评分7979 Microsoft Build 2026 发布 MAI 系列七款新模型,含首个推理模型 MAI-Thinking-1
Microsoft MAI 在 Build 2026 主题演讲中发布七款新模型,覆盖图像、语音、转录、推理和编码。
推荐理由:作者以当事方身份逐一公布七个新模型的定位、基准数字和开放渠道,读者可以对照竞品评估各自适用场景。
Microsoft AI NewsAI 评分4949 微软发布 MAI-Transcribe-1.5,新增关键词偏置功能
微软推出转录模型 MAI-Transcribe-1.5,新增关键词偏置功能,可让用户提供领域特定关键词列表来引导预测,模型会结合上下文判断是否应用偏置而非盲目强制匹配。在 FLEURS 多语言基准上,启用关键词偏置后词错误率(WER)降低 30%,在提升专业词汇识别的同时保持通用语音的准确率。
Sierra BlogAI 评分3434 Sierra 详解语音 AI 转录平台:多提供商集成与上下文感知如何降低错误率
Sierra 构建了一套语音转录平台,通过并行调用多个转录提供商进行集成、注入对话上下文,并支持 70+ 种语言,以解决姓名拼写歧义、行业术语识别等难题。其内部基准显示,集成方案平均将话语错误率降低约 25%,在部分语言中最高降低 37%;上下文感知转录使金融服务智能体的输入验证率提升超 25%,整体问题解决率最高提升 1%,重大转录错误减少最多 15%。
Runway News精选AI 评分6666 Runway 发布 Characters,单张图片生成 24fps 实时对话视频智能体
Runway 发布 Characters,基于 GWM-1 将单张参考图转为可实时对话的视频角色,无需微调,支持写实人像、卡通和吉祥物等风格。模型每帧有效耗时 37 毫秒,用户停止说话到角色开口的服务端延迟 1.75 秒;通过扩散变换器与 VAE 解码器流水线并行、KV-cache 管理、CUDA Graphs 和 Triton 核优化实现 24fps 实时生成。
推荐理由:官方技术博客拆解了实时管线的关键数字和系统优化,读者可以据此理解单图驱动的对话视频智能体的实现路径。