跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

当前仅显示精选新闻
83条精选相关主题多模态AI 视频产品更新

最新精选

第 41–60 条 · 共 83 条
7月23日周四
7月22日周三
7月20日周一
  1. ByteDance Seed Research65

    字节 Seed 发布音频创作模型 Seed Audio 1.0,统一生成人声、音效和环境声

    字节 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,端到端生成完整声音场景。模型支持 100ms 间隔的时间控制、零样本音色生成、单次约 2 分钟的延展生成,覆盖 20+ 语种;评测显示多数场景音频可用率达 90% 以上,多语种自然度 MOS 大部分超过 4 分。模型已在火山方舟体验中心上线。

    推荐理由:官方介绍统一框架下联合建模多种音频要素的思路,并给出时间控制精度、语种覆盖和评测数字,可用于了解音频创作模型的能力边界。

7月8日周三
6月24日周三
  1. 硅星人Pro · 微信公众号80

    火山引擎 Force 大会发布豆包 2.1 Pro、Seedance 2.0 4K 等 5 款模型

    火山引擎在 6 月 23 日 Force 大会上发布豆包大模型 2.1 Pro、Seedance 2.0 4K 等 5 款新模型。Seedance 2.5 将于 7 月初上线,支持 30 秒单段原生视频直出和最多 50 个全模态素材联合生成。

    推荐理由:文章给出豆包 2.1 Pro 与 Seedance 系列的发布细节,可看到一个云厂商把强模型当作云入口的整体打法。

  2. Hugging Face Blog63

    Hugging Face 与 Treble Technologies 发布 FFASR 远场 ASR 评测榜单

    Treble Technologies 与 Hugging Face 推出 FFASR 榜单,称其为首个开放的远场 ASR 基准,在 14 个仿真房间和不同信噪比条件下评测语音识别模型。榜单同时报告 WER 与 RTFx,现有提交显示低 SNR 下的远场 WER 普遍是近场 WER 的数倍。用户可在 Submit 页粘贴 Hugging Face 模型 ID,评测在服务端对留出数据集运行。

    推荐理由:新榜单将近场与远场语音识别的性能差距量化并公开,读者可据此判断模型在真实部署声学环境下的鲁棒性。

6月15日周一
  1. inclusionAI Hugging Face models65

    inclusionAI 发布 Ming-omni-tts-16.8B-A3B 统一音频生成模型

    inclusionAI 发布 Ming-omni-tts-16.8B-A3B 统一音频生成模型,可在单通道内联合合成语音、环境声与音乐。模型基于自研 12.5Hz 连续 tokenizer 与 Patch-by-Patch 压缩,将 LLM 推理帧率降至 3.1Hz,并内置 100+ 音色与零样本语音设计。

    推荐理由:该模型在单通道内联合生成语音、环境声与音乐,并用方言与情感控制基准对比 CosyVoice3 与 Qwen3-TTS。

6月10日周三
  1. @berryxia67

    Google 将 Gemini 3.5 Live Translate 推向公开预览,通过 Gemini API 提供低延迟语音到语音翻译,覆盖 70 多种语言和 2000 种语言对。作者指出它把小众语言对也纳入覆盖,可用于实时对话、客服、直播和跨国会议等场景,并提到目前尚不清楚它与阿里部分小语种模型的对比效果。

    引用Google for Developers (@googledevs)@googledevs

    Gemini 3.5 Live Translate is now in Public Preview via the Gemini API, delivering low-latency speech-to-speech translation across 70+ languages and 2,000 language pairs! 🌍 Challenge time: What is the most niche, unique, or complex language pair your application needs to translate? Tell us in the comments, and we’ll let you know if the model supports it! Full blog link: goo.gle/3QzaHwN Video

    推荐理由:Google 将 Gemini 3.5 实时语音翻译推向公开预览,可了解其对小众语言对的覆盖范围与 API 接入方式。

6月9日周二
  1. @googleaidevs70

    Google AI for Developers 公布了当天即可上手的两条路径:在 Google AI Studio 的实时游乐场 ai.studio/live 测试模型能力,以及通过 Gemini Live API 使用 AgoraIO、LiveKit、Pipecat、swmansion、visionagents.ai 等第三方生态集成。帖子列出的是接入入口与合作方,未说明具体模型版本。

    推荐理由:原文列出 Google AI Studio 实时试玩入口与 Gemini Live API 的第三方集成伙伴,开发者可据此直接接入。

6月4日周四
  1. Hugging Face Blog66

    NVIDIA Nemotron 3.5 ASR 如何微调适配特定语言、领域或口音

    NVIDIA 在 Hugging Face 博客给出 Nemotron 3.5 ASR 的微调流程,用约 2000 小时希腊语和保加利亚语数据微调后,在 80ms 流式设置下 WER 分别从 35 降到 24、从 22 降到 15。

    推荐理由:文章概述了从基础检查点微调流式多语种 ASR 的流程,并用希腊语和保加利亚语的 WER 变化说明微调对低资源语言的效果。

  2. @AYi_AInotes73

    Google 发布 Gemma 4 12B,一款基于 Apache 2.0 许可的免编码器统一多模态模型,把传统 ViT 视觉编码器的 150M-550M 参数压到 35M 轻量嵌入器。

    引用Google Gemma (@googlegemma)@googlegemma

    Meet Gemma 4 12B! A unified, encoder-free multimodal model designed to bring high-performance intelligence directly to your laptop, and released under an Apache 2.0 license. Bridging the gap between edge efficiency and advanced reasoning. Here is what’s new with Gemma 4 12B: 👇

    推荐理由:借 Gemma 4 12B 取消视觉编码器的设计,讨论统一多模态模型可能如何替代现有拼装式流水线。

  3. LMSYS Blog60

    Higgs Audio v3 TTS 上线 SGLang-Omni,支持实时流式语音与控制标签

    Boson AI 与 SGLang-Omni 团队宣布在 SGLang-Omni 上提供 Higgs Audio v3 TTS 的端到端服务。模型约 4B 参数,基于 Qwen3-4B,支持流式合成和 100 种语言的个位数 WER/CER,零样本克隆在 Seed-TTS 上 WER/CER 为 1.11%。

    推荐理由:原文给出多级推理架构、控制标签目录和基准延迟数据,开发者可据此评估把 TTS 接入语音 Agent 的可行性。

6月3日周三
  1. @berryxia71

    微软 AI 在 Build 上发布七个全新 MAI 模型,官方称并非简单迭代,而是从零开始、干净数据血统、零蒸馏训练的一整个家族,涵盖推理、编码、图像、转录与语音并各有 Flash 版本。

    引用Microsoft AI (@MicrosoftAI)@MicrosoftAI

    Seven new models launching at Build: let’s go! Reasoning. Code. Image. Transcribe. Voice. Built from scratch on a clean data lineage, designed for efficiency, working seamlessly as a family of models Thread 🧵 #MSBuild

    推荐理由:文中梳理了七个 MAI 模型的任务分工与基准数字,可据此了解微软从零训练、任务专精的模型家族路线。

  2. Microsoft AI News61

    Microsoft 发布 MAI-Voice-2 文本转语音模型

    Microsoft 发布文本转语音模型 MAI-Voice-2,在保真度、语言覆盖、说话人一致性和情感范围上较前代显著提升。支持语言从英语扩展到 15 种,提供情感标签细粒度控制,可用 5-60 秒参考音频零样本创建自定义声音,且生产环境仅允许授权声音合成。

    推荐理由:官方发布给出语言扩展、零样本克隆与偏好测试数据,读者可据此评估该语音模型在生产场景中的可用性。

6月2日周二
  1. @berryxia67

    Gemini Omni 上线数字头像功能,用户在 Gemini App 或网页的设置菜单点 Avatar,拍几张照片并录几句语音即可生成外貌与声音都像本人的数字分身。生成后在工具栏选中该 Avatar,就能把自己放进视频,普通用户几分钟可完成。所有用 Gemini Omni 生成的视频都会自动嵌入不可见 SynthID 数字水印,可在 Gemini App 中验证其是否为 AI 生成。

    引用Google Gemini (@GeminiApp)@GeminiApp

    Easily add yourself to your video creations in Gemini. Here’s how to create your own digital avatar that looks and sounds like you with Gemini Omni. 🧵

    推荐理由:原文给出三步生成数字分身并嵌入视频的流程,并说明 SynthID 水印可用于验证 AI 生成来源。

5月27日周三