跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

当前仅显示精选新闻
83条精选相关主题多模态AI 视频产品更新

最新精选

第 61–80 条 · 共 83 条
5月20日周三
  1. @antigravity70

    Antigravity 2.0 发布,是一款全新的独立桌面应用,主打面向智能体的完整体验。官方称其从底层重建,具备多智能体团队、定时任务、原生语音,以及与其他 Google 产品的一键集成能力,并附上了上手说明。

    推荐理由:Antigravity 2.0 把多智能体团队、定时任务和原生语音整合进独立桌面应用,并支持一键接入 Google 其他产品。

5月11日周一
  1. Thinking Machines Lab Blog73

    Thinking Machines Lab 发布 TML-Interaction-Small 交互模型研究预览

    Thinking Machines Lab 发布交互模型研究预览,模型原生处理音频、视频和文本的实时交互,而非依赖外部 harness。TML-Interaction-Small 为 276B 参数 MoE(12B 激活),采用 200ms 微轮次多流设计和无编码器早期融合,并配合异步后台模型处理深度推理。

    推荐理由:原文给出交互模型的技术路线、架构细节和基准对比,读者可据此评估原生交互与外挂式实时方案的能力差距。

5月8日周五
  1. @genspark_ai74

    Genspark 宣布 GPT-Realtime-2 已上线其平台,Call for Me Agent 现已运行在该模型上,Genspark Realtime Voice 也将随后升级。官方称其带来更清晰的推理、更严格的指令遵循,有效通话率提升 26%,掉线明显减少。OpenAI 同时在 API 中提供 GPT-Realtime-2,与流式模型 GPT-Realtime-Translate 和 GPT-Realtime-Whisper 一同上线。

    引用OpenAI (@OpenAI)@OpenAI

    Introducing GPT-Realtime-2 in the API: our most intelligent voice model yet, bringing GPT-5-class reasoning to voice agents. Voice agents are now real-time collaborators that can listen, reason, and solve complex problems as conversations unfold. Now available in the API alongside streaming models GPT-Realtime-Translate and GPT-Realtime-Whisper — a new set of audio capabilities for the next generation of voice interfaces. Video

    推荐理由:Genspark 给出了接入 GPT-Realtime-2 后自家语音智能体的通话指标变化,可用来观察语音智能体在真实通话场景中的提升幅度。

  2. @diegocabezas0166

    OpenAI 将新语音模型 gpt-realtime-2 上线 API,开发者 @diegocabezas01 发布了自建演示。被引用的 @sama 表示,人们正越来越多地用语音与 AI 交互,尤其是在需要输入大量上下文的场景,并称这是相当大的一步进展,同时提到团队正在改进聊天中的语音体验。

    引用Sam Altman (@sama)@sama

    people are really starting to use voice to interact with AI, especially when they have a lot of context to dump. GPT-Realtime-2 comes to the API today; it is a pretty big step forward. (we are working on improvements to voice in chat.)

    推荐理由:OpenAI 把 gpt-realtime-2 语音模型带进 API,并附开发者自建演示,可据此了解语音交互的使用场景。

5月4日周一
  1. Runway News66

    Runway 发布 Characters,单张图片生成 24fps 实时对话视频智能体

    Runway 发布 Characters,基于 GWM-1 将单张参考图转为可实时对话的视频角色,无需微调,支持写实人像、卡通和吉祥物等风格。模型每帧有效耗时 37 毫秒,用户停止说话到角色开口的服务端延迟 1.75 秒;通过扩散变换器与 VAE 解码器流水线并行、KV-cache 管理、CUDA Graphs 和 Triton 核优化实现 24fps 实时生成。

    推荐理由:官方技术博客拆解了实时管线的关键数字和系统优化,读者可以据此理解单图驱动的对话视频智能体的实现路径。

5月2日周六
  1. Sierra Blog64

    Sierra 发布 𝜏-voice 基准,在真实语音条件下评测实时语音 Agent

    Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。

    推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。

4月30日周四
  1. AI前线 · 微信公众号77

    MiniCPM-o 4.5 技术报告发布:全双工全模态 API 开放,RTX5070 即可实时运行

    面壁智能联合 OpenBMB、清华大学 THUNLP 与 THUMAI 实验室发布 MiniCPM-o 4.5 技术报告,首次公开全双工全模态框架 Omni-Flow,并同步开放全模态全双工 API、在线 Demo、端侧安装包 Comni 与 Demo 仓库。

    推荐理由:技术报告首次公开 Omni-Flow 的毫秒级时间轴对齐机制,读者可据此理解端到端全双工全模态的实现路径。

4月28日周二
4月16日周四
4月2日周四
3月26日周四
  1. Suno Blog66

    Suno 发布 v5.5 模型,推出 Voices、Custom models 和 My Taste 个性化功能

    Suno 发布 v5.5 模型,同时推出三项个性化功能。Voices 让用户采集自己的声音来创作音乐,包含验证流程且默认私密,面向 Pro 和 Premier 订阅者;Custom models 可基于自有曲目调出个性化模型,最多可建三个;My Taste 根据用户偏好学习风格,面向所有用户。官方称这些能力为今年晚些时候与音乐行业合作推出的新一代音乐模型打基础。

    推荐理由:原文交代了新功能的具体机制与订阅限制,读者可据此判断如何用自己的声音和风格来创作音乐。

3月24日周二
  1. Mistral AI66

    Mistral AI 发布首个语音合成模型 Voxtral TTS

    Mistral AI 发布 4B 参数的文本转语音模型 Voxtral TTS,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,API 定价 $0.016 per 1k characters。

    推荐理由:官方给出了与 ElevenLabs 对比的人类评测数据和低延迟指标,读者可据此评估其在语音 Agent 场景的可用性。

2月5日周四
  1. Mistral AI64

    Mistral 发布 Voxtral Transcribe 2 语音转写模型,Realtime 开放权重

    Mistral 发布 Voxtral Transcribe 2 系列,包含 Voxtral Mini Transcribe V2(批量转写)和 Voxtral Realtime(实时转写),支持 13 种语言的说话人分离、上下文偏置和词级时间戳。

    推荐理由:官方给出了两个语音转写模型的具体延迟、错误率和价格,并开放了 Voxtral Realtime 权重,便于按场景选型。

11月25日周二
  1. Suno Blog69

    Suno 与 Warner Music Group 达成合作,推出授权音乐训练的新一代模型

    Suno 宣布与 Warner Music Group(WMG)达成新合作,将用高质量授权音乐训练新一代模型,称其将超越目前最好的 v5。WMG 艺人可自愿授权姓名、形象、声音和作品用于 AI 生成音乐并获得新收入;未来下载歌曲需付费账号,各付费档位含每月下载额度,Suno Studio 保持不变并保留无限下载。

    推荐理由:Suno 官方说明与 Warner Music Group 合作后的产品变化,包括付费下载门槛和授权模型计划,读者可据此调整使用方式。

11月19日周三
  1. Suno Blog60

    Suno 宣布完成 2.5 亿美元 C 轮融资,投后估值 24.5 亿美元

    Suno 宣布完成 2.5 亿美元 Series C 融资,投后估值 24.5 亿美元,由 Menlo Ventures 领投,NVentures(NVIDIA 风投部门)、Hallwood Media、Lightspeed 和 Matrix 参投。过去两年近 1 亿人在 Suno 上创作过音乐,公司称将用新资金为专业音乐人开发更复杂的工具、改善休闲创作者体验,并建设音乐社交与分享生态。

    推荐理由:官方公告给出融资金额、估值和投资方名单,并说明资金将投向专业工具与社交功能的扩展方向。

8月29日周五
7月17日周四
  1. Mistral AI61

    Mistral AI 为 Le Chat 推出 Deep Research、语音、Projects 等多项新功能

    Mistral AI 为 Le Chat 推出一批新功能,包括 Deep Research 预览模式、基于 Voxtral 的语音模式、由 Magistral 驱动的多语言推理、Projects 项目整理功能,以及与 Black Forest Labs 合作的高级图像编辑。

    推荐理由:Mistral 官方一次性列出五项新功能及其支撑模型,读者可以对照了解 Le Chat 在研究和多模态方向的能力变化。

7月15日周二
6月3日周二
  1. Suno Blog68

    Suno 升级 Song Editor 并支持 8 分钟音频上传与 12 轨 stems 分离

    Suno 发布一组创作控制功能:升级版 Song Editor 可在波形上逐段重排、改写和重制曲目,并可将曲目拆分为 12 条干净 stems(人声、鼓、贝斯等)预览和下载。音频上传扩展至最长 8 分钟,可从自己的完整曲目或吉他 riff 开始创作,另新增三个创意滑杆控制生成风格,支持导出后在 DAW 中继续编辑。

    推荐理由:原文列出了 Song Editor、stems 分离和上传上限等具体能力,读者可以对照自己现有的创作流程判断是否用得上。

5月1日周四
  1. Suno Blog64

    Suno 发布 v4.5 音乐生成模型

    Suno 发布最新音乐生成模型 v4.5,曲风选项大幅扩充且更贴合描述,人声情感与音域增强,歌曲最长可达 8 分钟。新增提示词增强助手,Covers 与 Personas 可组合使用,生成速度与音频质量也有明显提升。

    推荐理由:官方公告列出了 v4.5 在曲风、人声、音质和生成速度上的具体改进,音乐创作工作流的变化可以直接对照查看。