Claude 语音模式接入 Opus 与 Sonnet,支持连接工具和多语言
Claude 语音模式现已运行在 Claude Opus、Sonnet 和 Haiku 上,可调用 Gmail、Slack 等已连接工具,并新增法语、德语、印地语、日语、韩语等多种语言。
推荐理由:语音模式此前只跑 Haiku,如今接入 Opus 和 Sonnet 并打通已连接工具,让口头推演能直接落到执行。
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
当前仅显示精选新闻Claude 语音模式现已运行在 Claude Opus、Sonnet 和 Haiku 上,可调用 Gmail、Slack 等已连接工具,并新增法语、德语、印地语、日语、韩语等多种语言。
推荐理由:语音模式此前只跑 Haiku,如今接入 Opus 和 Sonnet 并打通已连接工具,让口头推演能直接落到执行。
OpenRouter 上线 POST /api/v1/audio/transcriptions 音频转写端点,复用 Chat Completions 的同一 API key 和鉴权。
推荐理由:官方教程给出了完整的请求参数、限制和计费细节,读者可以直接照抄接入而不必自建 Whisper 服务。
字节 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,端到端生成完整声音场景。模型支持 100ms 间隔的时间控制、零样本音色生成、单次约 2 分钟的延展生成,覆盖 20+ 语种;评测显示多数场景音频可用率达 90% 以上,多语种自然度 MOS 大部分超过 4 分。模型已在火山方舟体验中心上线。
推荐理由:官方介绍统一框架下联合建模多种音频要素的思路,并给出时间控制精度、语种覆盖和评测数字,可用于了解音频创作模型的能力边界。
OpenAI 发布新一代语音模型 GPT-Live,面向更自然的人机交互,目前已在 ChatGPT Voice 中投入使用。
推荐理由:原文交代新一代语音模型已接入 ChatGPT Voice,读者可据此了解语音交互这一侧的换代入口。
火山引擎在 6 月 23 日 Force 大会上发布豆包大模型 2.1 Pro、Seedance 2.0 4K 等 5 款新模型。Seedance 2.5 将于 7 月初上线,支持 30 秒单段原生视频直出和最多 50 个全模态素材联合生成。
推荐理由:文章给出豆包 2.1 Pro 与 Seedance 系列的发布细节,可看到一个云厂商把强模型当作云入口的整体打法。
Treble Technologies 与 Hugging Face 推出 FFASR 榜单,称其为首个开放的远场 ASR 基准,在 14 个仿真房间和不同信噪比条件下评测语音识别模型。榜单同时报告 WER 与 RTFx,现有提交显示低 SNR 下的远场 WER 普遍是近场 WER 的数倍。用户可在 Submit 页粘贴 Hugging Face 模型 ID,评测在服务端对留出数据集运行。
推荐理由:新榜单将近场与远场语音识别的性能差距量化并公开,读者可据此判断模型在真实部署声学环境下的鲁棒性。
inclusionAI 发布 Ming-omni-tts-16.8B-A3B 统一音频生成模型,可在单通道内联合合成语音、环境声与音乐。模型基于自研 12.5Hz 连续 tokenizer 与 Patch-by-Patch 压缩,将 LLM 推理帧率降至 3.1Hz,并内置 100+ 音色与零样本语音设计。
推荐理由:该模型在单通道内联合生成语音、环境声与音乐,并用方言与情感控制基准对比 CosyVoice3 与 Qwen3-TTS。
Gemini 3.5 Live Translate is now in Public Preview via the Gemini API, delivering low-latency speech-to-speech translation across 70+ languages and 2,000 language pairs! 🌍 Challenge time: What is the most niche, unique, or complex language pair your application needs to translate? Tell us in the comments, and we’ll let you know if the model supports it! Full blog link: goo.gle/3QzaHwN Video
推荐理由:Google 将 Gemini 3.5 实时语音翻译推向公开预览,可了解其对小众语言对的覆盖范围与 API 接入方式。
谷歌发布实时语音互译音频模型 Gemini 3.5 Live Translate,可自动识别 70 多种语言并生成保留说话者语调、语速和音高的翻译语音,翻译通常只比说话者慢几秒。
推荐理由:新模型用连续生成语音在上下文与即时性之间取得平衡,落地入口覆盖谷歌翻译、Meet 和 API。
推荐理由:原文列出 Google AI Studio 实时试玩入口与 Gemini Live API 的第三方集成伙伴,开发者可据此直接接入。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70+ 语言近实时语音到语音翻译,自动检测语言并保留说话者的语调、节奏和音高,全程仅落后说话者几秒。
推荐理由:原文给出模型能力、开放渠道和 Meet 语言扩展细节,读者可据此评估它在会议和翻译场景的可用性。
苹果在 WWDC 2026 发布全量重建的 Siri AI,可读取屏幕内容、从消息邮件与相册中提取上下文并串联跨应用操作,同时上线独立 Siri 应用,对话历史通过 iCloud 同步。


推荐理由:作者以现场视角梳理 Siri AI 的 Gemini 底层与发布会取舍,便于读者对照官方信息理解苹果补了什么、缺了什么。
NVIDIA 在 Hugging Face 博客给出 Nemotron 3.5 ASR 的微调流程,用约 2000 小时希腊语和保加利亚语数据微调后,在 80ms 流式设置下 WER 分别从 35 降到 24、从 22 降到 15。
推荐理由:文章概述了从基础检查点微调流式多语种 ASR 的流程,并用希腊语和保加利亚语的 WER 变化说明微调对低资源语言的效果。
Google 发布 Gemma 4 12B,一款基于 Apache 2.0 许可的免编码器统一多模态模型,把传统 ViT 视觉编码器的 150M-550M 参数压到 35M 轻量嵌入器。


Meet Gemma 4 12B! A unified, encoder-free multimodal model designed to bring high-performance intelligence directly to your laptop, and released under an Apache 2.0 license. Bridging the gap between edge efficiency and advanced reasoning. Here is what’s new with Gemma 4 12B: 👇
推荐理由:借 Gemma 4 12B 取消视觉编码器的设计,讨论统一多模态模型可能如何替代现有拼装式流水线。
Boson AI 与 SGLang-Omni 团队宣布在 SGLang-Omni 上提供 Higgs Audio v3 TTS 的端到端服务。模型约 4B 参数,基于 Qwen3-4B,支持流式合成和 100 种语言的个位数 WER/CER,零样本克隆在 Seed-TTS 上 WER/CER 为 1.11%。
推荐理由:原文给出多级推理架构、控制标签目录和基准延迟数据,开发者可据此评估把 TTS 接入语音 Agent 的可行性。
微软 AI 在 Build 上发布七个全新 MAI 模型,官方称并非简单迭代,而是从零开始、干净数据血统、零蒸馏训练的一整个家族,涵盖推理、编码、图像、转录与语音并各有 Flash 版本。
Seven new models launching at Build: let’s go! Reasoning. Code. Image. Transcribe. Voice. Built from scratch on a clean data lineage, designed for efficiency, working seamlessly as a family of models Thread 🧵 #MSBuild
推荐理由:文中梳理了七个 MAI 模型的任务分工与基准数字,可据此了解微软从零训练、任务专精的模型家族路线。
Microsoft 发布文本转语音模型 MAI-Voice-2,在保真度、语言覆盖、说话人一致性和情感范围上较前代显著提升。支持语言从英语扩展到 15 种,提供情感标签细粒度控制,可用 5-60 秒参考音频零样本创建自定义声音,且生产环境仅允许授权声音合成。
推荐理由:官方发布给出语言扩展、零样本克隆与偏好测试数据,读者可据此评估该语音模型在生产场景中的可用性。
Microsoft MAI 在 Build 2026 主题演讲中发布七款新模型,覆盖图像、语音、转录、推理和编码。
推荐理由:作者以当事方身份逐一公布七个新模型的定位、基准数字和开放渠道,读者可以对照竞品评估各自适用场景。
Easily add yourself to your video creations in Gemini. Here’s how to create your own digital avatar that looks and sounds like you with Gemini Omni. 🧵
推荐理由:原文给出三步生成数字分身并嵌入视频的流程,并说明 SynthID 水印可用于验证 AI 生成来源。
Hugging Face 发布教程,用自家 speech-to-speech 库把 Reachy Mini 的对话链路全部搬到本地,无需云服务、API key,音频不出本机。
推荐理由:给出了一条可整套照搬的本地语音链路,读者能据此把 VAD、STT、LLM、TTS 各环节换成自己的模型。