跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

当前仅显示精选新闻
74条精选相关主题多模态AI 视频产品更新

最新精选

第 1–20 条 · 共 74 条
10月3日周六
  1. DeepTech深科技 · 微信公众号67

    Tavus 发布全双工人类交互模型 Griffin,48% 受试者误认其为真人

    Tavus 于 10 月 1 日发布全双工视频到视频模型 Griffin(研究预览版 Griffin-Lite),将感知、决策和生成整合进端到端系统,替代传统级联架构。

    推荐理由:原文给出了 Griffin 的架构思路、VideoFDB 评测数据和盲测结果,读者可对比级联方案与端到端实时交互的差异。

10月2日周五
  1. Microsoft AI News61

    Microsoft AI 发布 MAI-Transcribe-2-Streaming 及 MAI-Voice-2.1 语音模型

    Microsoft AI 发布实时流式转写模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 的最终与部分转写准确率均排名第一,支持 60 种语言,接收到音频后约 100ms 内产出首个 partials,内部评测显示实时听写场景出词速度比最接近的竞品快 2x,年底前 introductory 价 $0.54 每小时音频。

    推荐理由:官方公布三款语音模型的具体定价、延迟数字和 Artificial Analysis 排名,可据此评估搭建语音智能体的成本与速度。

10月1日周四
  1. Suno Blog67

    Suno 推出 Speech 测试版,可同时生成语音与背景音乐

    Suno 发布 Speech 测试版,称其为首个能把语音和音乐作为一条完整音轨共同生成的音频模型。用户输入文字并描述声音与音乐风格,即可生成配有原创背景音乐的语音内容;此前已小范围测试一个月,现向所有用户开放,团队表示会持续改进。

    推荐理由:原文说明了 Speech 将语音与音乐合成为一条轨道的玩法和开放范围,读者可据此判断它带来哪些新用途。

9月24日周四
  1. Greg Brockman78

    ChatGPT Voice 重大升级,可调用邮件、日历、Slack 等插件,并可由 GPT-6 Astra、Sol 和 Luna 驱动。用户可在网页和移动端的 ChatGPT Work 中仅凭语音创建文档、演示文稿、网站和表格,或通过浏览器完成复杂任务,今日起在全球最新版本应用中推出。

    引用OpenAI@OpenAI

    We heard you loud and clear. ChatGPT Voice can now: - Use plugins like your email, calendar, and Slack. - Be powered by GPT-6 Astra, Sol, and Luna. - Be used in ChatGPT Work on web and mobile, so you can create docs, decks, sites, and spreadsheets or tackle complex tasks in the browser, just by talking. Rolling out globally today in the latest version of the app.

    推荐理由:原文列出了语音可用的插件类型和可用入口,读者可以据此判断日常语音助手工作流会有哪些变化。

9月23日周三
  1. Google DeepMind68

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词设计角色声音、30 秒音频样本复刻声音,并逐行指挥表演。

    推荐理由:原文给出两个 TTS 模型的定位差异、基准成绩和开放渠道,读者可据此评估语音生成工作流的选型。

9月16日周三
  1. Google Blog: AI64

    Google 公布多语言 AI 进展:Gemini 3.5 Live Translate 支持 70 种语言实时口译,TranslateGemma 可离线运行

    Google 宣布其语言技术已覆盖 300 多种语言、服务超 70 亿人,占全球人口 86%。Gemini 3.5 Live Translate 支持 70 种语言。

    推荐理由:官方梳理了从实时翻译到无障碍设计的语言 AI 布局,并给出各产品的覆盖语言数和合作项目,可作了解现状的参考。

9月11日周五
  1. @gdb70

    OpenAI 在 API 中开放 GPT-Live-1,开发者可把 ChatGPT 式的自然对话体验接入自己的应用。该语音智能体可在说话的同时持续聆听,并支持搭配开发者自选的模型与 harness。

    引用@OpenAIDevs@OpenAIDevs

    GPT-Live-1 is now available in the API. Bring ChatGPT’s natural back-and-forth to your app, with voice agents that listen while they speak and work with the models and harness you choose. https://t.co/gIl1gwsBDV

    推荐理由:GPT-Live-1 开放 API 后,开发者可把边听边说的语音智能体接入自家应用并自选模型与 harness。

  2. @testingcatalog71

    OpenAI 已在 API 与 OpenAI Platform 上线 GPT-Live-1,把 ChatGPT 的全双工自然对话能力开放给开发者,并让语音智能体的说话与行为获得更多控制。开发者可以用双向语音模式构建应用和工作流,把任务转派给其他模型,也可自行选择搭配的模型与 harness。

    原始视频预览图;未保存可播放视频URL
    引用@OpenAIDevs@OpenAIDevs

    GPT-Live-1 is now available in the API. Bring ChatGPT’s natural back-and-forth to your app, with voice agents that listen while they speak and work with the models and harness you choose. https://t.co/gIl1gwsBDV

    推荐理由:全双工语音对话能力开放到 API,开发者可搭建可转派任务的语音智能体,语音应用的工作流编排随之变化。

  3. @Thom_Wolf69

    OpenAI 开发者账号宣布 GPT-Live-1 已在 API 中可用,开发者可在自有应用中接入能边听边说的语音智能体,并自行选择模型与框架。Hugging Face 联创 Thomas Wolf 转发了这条消息,并配上一张机器人图片。

    引用@OpenAIDevs@OpenAIDevs

    GPT-Live-1 is now available in the API. Bring ChatGPT’s natural back-and-forth to your app, with voice agents that listen while they speak and work with the models and harness you choose. https://t.co/gIl1gwsBDV

    推荐理由:OpenAI 将 GPT-Live-1 语音能力放进 API,开发者可据此判断语音智能体的接入方式。

  4. @thsottiaux68

    OpenAI 将 ChatGPT 的语音系统以 GPT-Live-1 的形式开放到 API,开发者可在自己的应用中接入边听边说的语音智能体。该语音系统此前已在 ChatGPT 中服务 10 亿用户,作者提到全双工系统配合稳定的工具调用有大量应用场景。

    引用@OpenAIDevs@OpenAIDevs

    GPT-Live-1 is now available in the API. Bring ChatGPT’s natural back-and-forth to your app, with voice agents that listen while they speak and work with the models and harness you choose. https://t.co/gIl1gwsBDV

    推荐理由:同一套语音系统从 ChatGPT 走向 API,读者可了解开发者如何构建边听边说的语音智能体。

  5. @OpenAIDevs71

    OpenAI Developers 宣布 GPT-Live-1 已在 API 中上线,可把 ChatGPT 的自然多轮对话体验带进应用。该模型面向语音智能体,特点是在说话的同时继续聆听,并支持用户选择所用的模型与 harness。官方同时给出接入链接 https://t.co/gIl1gwsBDV。

    原始视频预览图;未保存可播放视频URL

    推荐理由:语音智能体能在说话的同时继续聆听,并可自选模型与 harness,读者可据此判断接入方式。

9月10日周四
  1. IT Home79

    米哈游《原神》角色声音被仿冒获赔 75 万元,上海首例涉 AI 声音仿冒不正当竞争案宣判

    上海市浦东新区人民法院宣判上海首例涉 AI 声音仿冒不正当竞争纠纷案,判令被告立即停止不正当竞争行为并赔偿米哈游 75 万元。被告运营的 AI 变声软件提供《原神》63 款角色的声音资源包供用户付费变声,并在庭审中承认未获授权使用角色一分钟音频混合其他素材训练其 AI 变声模型。

    推荐理由:上海首例涉 AI 声音仿冒案的判决将游戏角色音色认定为具有商业标识功能,明确了 AI 变声训练的授权边界。

9月9日周三
9月5日周六
8月28日周五