Tavus 发布全双工人类交互模型 Griffin,48% 受试者误认其为真人
Tavus 于 10 月 1 日发布全双工视频到视频模型 Griffin(研究预览版 Griffin-Lite),将感知、决策和生成整合进端到端系统,替代传统级联架构。
推荐理由:原文给出了 Griffin 的架构思路、VideoFDB 评测数据和盲测结果,读者可对比级联方案与端到端实时交互的差异。
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
当前仅显示精选新闻Tavus 于 10 月 1 日发布全双工视频到视频模型 Griffin(研究预览版 Griffin-Lite),将感知、决策和生成整合进端到端系统,替代传统级联架构。
推荐理由:原文给出了 Griffin 的架构思路、VideoFDB 评测数据和盲测结果,读者可对比级联方案与端到端实时交互的差异。
Microsoft AI 发布实时流式转写模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 的最终与部分转写准确率均排名第一,支持 60 种语言,接收到音频后约 100ms 内产出首个 partials,内部评测显示实时听写场景出词速度比最接近的竞品快 2x,年底前 introductory 价 $0.54 每小时音频。
推荐理由:官方公布三款语音模型的具体定价、延迟数字和 Artificial Analysis 排名,可据此评估搭建语音智能体的成本与速度。
Suno 发布 Speech 测试版,称其为首个能把语音和音乐作为一条完整音轨共同生成的音频模型。用户输入文字并描述声音与音乐风格,即可生成配有原创背景音乐的语音内容;此前已小范围测试一个月,现向所有用户开放,团队表示会持续改进。
推荐理由:原文说明了 Speech 将语音与音乐合成为一条轨道的玩法和开放范围,读者可据此判断它带来哪些新用途。
We heard you loud and clear. ChatGPT Voice can now: - Use plugins like your email, calendar, and Slack. - Be powered by GPT-6 Astra, Sol, and Luna. - Be used in ChatGPT Work on web and mobile, so you can create docs, decks, sites, and spreadsheets or tackle complex tasks in the browser, just by talking. Rolling out globally today in the latest version of the app.
推荐理由:原文列出了语音可用的插件类型和可用入口,读者可以据此判断日常语音助手工作流会有哪些变化。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词设计角色声音、30 秒音频样本复刻声音,并逐行指挥表演。
推荐理由:原文给出两个 TTS 模型的定位差异、基准成绩和开放渠道,读者可据此评估语音生成工作流的选型。
Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,把语音、视觉、推理和 Tool Calling 放进同一条持续运行的链路。
推荐理由:文章从异步 Tool、KV Cache 和调度角度拆解实时语音会话背后的系统问题,读者可以迁移到自己的 Agent Runtime 设计。
Google AI 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音模型。
推荐理由:原文分述两款语音模型的能力差异与使用场景,读者可据此判断选型方向。
Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两个实时语音对话模型,主打近实时推理与语音智能体。
推荐理由:官方给出两个新语音模型的定位分工和多项基准数字,读者可据此判断其适合规模化还是高复杂度语音任务。
Google 宣布其语言技术已覆盖 300 多种语言、服务超 70 亿人,占全球人口 86%。Gemini 3.5 Live Translate 支持 70 种语言。
推荐理由:官方梳理了从实时翻译到无障碍设计的语言 AI 布局,并给出各产品的覆盖语言数和合作项目,可作了解现状的参考。
OpenAI 在 API 中开放 GPT-Live-1,开发者可把 ChatGPT 式的自然对话体验接入自己的应用。该语音智能体可在说话的同时持续聆听,并支持搭配开发者自选的模型与 harness。
GPT-Live-1 is now available in the API. Bring ChatGPT’s natural back-and-forth to your app, with voice agents that listen while they speak and work with the models and harness you choose. https://t.co/gIl1gwsBDV
推荐理由:GPT-Live-1 开放 API 后,开发者可把边听边说的语音智能体接入自家应用并自选模型与 harness。
GPT-Live-1 is now available in the API. Bring ChatGPT’s natural back-and-forth to your app, with voice agents that listen while they speak and work with the models and harness you choose. https://t.co/gIl1gwsBDV
推荐理由:全双工语音对话能力开放到 API,开发者可搭建可转派任务的语音智能体,语音应用的工作流编排随之变化。
GPT-Live-1 is now available in the API. Bring ChatGPT’s natural back-and-forth to your app, with voice agents that listen while they speak and work with the models and harness you choose. https://t.co/gIl1gwsBDV
推荐理由:OpenAI 将 GPT-Live-1 语音能力放进 API,开发者可据此判断语音智能体的接入方式。
推荐理由:原文列出 GPT-Live-1 在多项语音基准上与前代的对比数据,可用于判断语音智能体完成多轮客服任务的能力变化。
GPT-Live-1 is now available in the API. Bring ChatGPT’s natural back-and-forth to your app, with voice agents that listen while they speak and work with the models and harness you choose. https://t.co/gIl1gwsBDV
推荐理由:同一套语音系统从 ChatGPT 走向 API,读者可了解开发者如何构建边听边说的语音智能体。
推荐理由:语音智能体能在说话的同时继续聆听,并可自选模型与 harness,读者可据此判断接入方式。
上海市浦东新区人民法院宣判上海首例涉 AI 声音仿冒不正当竞争纠纷案,判令被告立即停止不正当竞争行为并赔偿米哈游 75 万元。被告运营的 AI 变声软件提供《原神》63 款角色的声音资源包供用户付费变声,并在庭审中承认未获授权使用角色一分钟音频混合其他素材训练其 AI 变声模型。
推荐理由:上海首例涉 AI 声音仿冒案的判决将游戏角色音色认定为具有商业标识功能,明确了 AI 变声训练的授权边界。
OpenAI 在 API 中推出语音模型 GPT‑Live‑1,支持自然的全双工语音对话。模型具备更强的指令遵循能力,支持自定义音色和电话场景。
推荐理由:官方摘要指出模型新增全双工语音、自定义音色和电话支持,可据此了解 API 语音能力的扩展方向。
Suno 发布 v6 新一代音乐模型,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,并最终以下一代模型替换旧模型。
推荐理由:原文由官方给出三档模型分工与具体编辑能力示例,读者可以据此判断新工作流是否适合自己。
推荐理由:谷歌把整曲生成模型 Lyria 3.5 同步铺到 AI Studio、Gemini app 与 API,可据此观察音乐生成在消费端和接口层的落地方式。
Gemini Live 面向全球免费开放。各集成功能的可用范围、兼容性和年龄限制存在差异,部分集成可能需要完成设置或订阅。官方博客给出了具体使用方式。
推荐理由:Gemini Live 免费向全球开放,读者可据此了解各集成功能在可用范围与年龄限制上的差异。