推荐理由:Antigravity 2.0 把多智能体团队、定时任务和原生语音整合进独立桌面应用,并支持一键接入 Google 其他产品。
语音与音频
全部主题AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
当前仅显示精选新闻最新精选
第 61–80 条 · 共 83 条@antigravity@antigravity精选AI 评分7070 
Thinking Machines Lab Blog精选AI 评分7373 Thinking Machines Lab 发布 TML-Interaction-Small 交互模型研究预览
Thinking Machines Lab 发布交互模型研究预览,模型原生处理音频、视频和文本的实时交互,而非依赖外部 harness。TML-Interaction-Small 为 276B 参数 MoE(12B 激活),采用 200ms 微轮次多流设计和无编码器早期融合,并配合异步后台模型处理深度推理。
推荐理由:原文给出交互模型的技术路线、架构细节和基准对比,读者可据此评估原生交互与外挂式实时方案的能力差距。
@genspark_ai@genspark_ai精选AI 评分7474 引用OpenAI (@OpenAI)@OpenAIIntroducing GPT-Realtime-2 in the API: our most intelligent voice model yet, bringing GPT-5-class reasoning to voice agents. Voice agents are now real-time collaborators that can listen, reason, and solve complex problems as conversations unfold. Now available in the API alongside streaming models GPT-Realtime-Translate and GPT-Realtime-Whisper — a new set of audio capabilities for the next generation of voice interfaces. Video
推荐理由:Genspark 给出了接入 GPT-Realtime-2 后自家语音智能体的通话指标变化,可用来观察语音智能体在真实通话场景中的提升幅度。
@diegocabezas01@diegocabezas01精选AI 评分6666
引用Sam Altman (@sama)@samapeople are really starting to use voice to interact with AI, especially when they have a lot of context to dump. GPT-Realtime-2 comes to the API today; it is a pretty big step forward. (we are working on improvements to voice in chat.)
推荐理由:OpenAI 把 gpt-realtime-2 语音模型带进 API,并附开发者自建演示,可据此了解语音交互的使用场景。
Runway News精选AI 评分6666 Runway 发布 Characters,单张图片生成 24fps 实时对话视频智能体
Runway 发布 Characters,基于 GWM-1 将单张参考图转为可实时对话的视频角色,无需微调,支持写实人像、卡通和吉祥物等风格。模型每帧有效耗时 37 毫秒,用户停止说话到角色开口的服务端延迟 1.75 秒;通过扩散变换器与 VAE 解码器流水线并行、KV-cache 管理、CUDA Graphs 和 Triton 核优化实现 24fps 实时生成。
推荐理由:官方技术博客拆解了实时管线的关键数字和系统优化,读者可以据此理解单图驱动的对话视频智能体的实现路径。
Sierra Blog精选AI 评分6464 Sierra 发布 𝜏-voice 基准,在真实语音条件下评测实时语音 Agent
Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。
推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。
AI前线 · 微信公众号精选AI 评分7777 MiniCPM-o 4.5 技术报告发布:全双工全模态 API 开放,RTX5070 即可实时运行
面壁智能联合 OpenBMB、清华大学 THUNLP 与 THUMAI 实验室发布 MiniCPM-o 4.5 技术报告,首次公开全双工全模态框架 Omni-Flow,并同步开放全模态全双工 API、在线 Demo、端侧安装包 Comni 与 Demo 仓库。
推荐理由:技术报告首次公开 Omni-Flow 的毫秒级时间轴对齐机制,读者可据此理解端到端全双工全模态的实现路径。
Hugging Face Blog精选AI 评分8080 NVIDIA 发布 Nemotron 3 Nano Omni 长上下文多模态模型
NVIDIA 发布开源全能多模态理解模型 Nemotron 3 Nano Omni 30B-A3B,在 OCRBenchV2-En 得分 65.8、MMLongBench-Doc 57.5,并新增音频与视频理解能力。
推荐理由:原文列出文档、视频与音频榜单成绩及吞吐对比,读者可据此判断该开源全能模型的能力边界。
Google DeepMind精选AI 评分6363 Google DeepMind 发布 Gemini 3.1 Flash TTS,新增 audio tags 语音控制
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,改进可控性、表现力和质量,在 Artificial Analysis TTS 排行榜获得 1,211 Elo 分。
推荐理由:官方介绍新增 audio tags 和多说话人对话能力,还给出 AI Studio 导演式控制与 API 导出的具体用法,便于开发者评估接入。
Microsoft AI News精选AI 评分6363 Microsoft 发布 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2 三款模型并上线 Foundry
Microsoft AI 宣布发布 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2 三款模型,现已在 Microsoft Foundry 和 MAI Playground 开放。
推荐理由:官方公布三款 MAI 模型的 Foundry 定价与基准对比,开发者可直接据此评估接入成本和可用性。
Suno Blog精选AI 评分6666 Suno 发布 v5.5 模型,推出 Voices、Custom models 和 My Taste 个性化功能
Suno 发布 v5.5 模型,同时推出三项个性化功能。Voices 让用户采集自己的声音来创作音乐,包含验证流程且默认私密,面向 Pro 和 Premier 订阅者;Custom models 可基于自有曲目调出个性化模型,最多可建三个;My Taste 根据用户偏好学习风格,面向所有用户。官方称这些能力为今年晚些时候与音乐行业合作推出的新一代音乐模型打基础。
推荐理由:原文交代了新功能的具体机制与订阅限制,读者可据此判断如何用自己的声音和风格来创作音乐。
Mistral AI精选AI 评分6666 Mistral AI 发布首个语音合成模型 Voxtral TTS
Mistral AI 发布 4B 参数的文本转语音模型 Voxtral TTS,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,API 定价 $0.016 per 1k characters。
推荐理由:官方给出了与 ElevenLabs 对比的人类评测数据和低延迟指标,读者可据此评估其在语音 Agent 场景的可用性。
Mistral AI精选AI 评分6464 Mistral 发布 Voxtral Transcribe 2 语音转写模型,Realtime 开放权重
Mistral 发布 Voxtral Transcribe 2 系列,包含 Voxtral Mini Transcribe V2(批量转写)和 Voxtral Realtime(实时转写),支持 13 种语言的说话人分离、上下文偏置和词级时间戳。
推荐理由:官方给出了两个语音转写模型的具体延迟、错误率和价格,并开放了 Voxtral Realtime 权重,便于按场景选型。
Suno Blog精选AI 评分6969 Suno 与 Warner Music Group 达成合作,推出授权音乐训练的新一代模型
Suno 宣布与 Warner Music Group(WMG)达成新合作,将用高质量授权音乐训练新一代模型,称其将超越目前最好的 v5。WMG 艺人可自愿授权姓名、形象、声音和作品用于 AI 生成音乐并获得新收入;未来下载歌曲需付费账号,各付费档位含每月下载额度,Suno Studio 保持不变并保留无限下载。
推荐理由:Suno 官方说明与 Warner Music Group 合作后的产品变化,包括付费下载门槛和授权模型计划,读者可据此调整使用方式。
Suno Blog精选AI 评分6060 Suno 宣布完成 2.5 亿美元 C 轮融资,投后估值 24.5 亿美元
Suno 宣布完成 2.5 亿美元 Series C 融资,投后估值 24.5 亿美元,由 Menlo Ventures 领投,NVentures(NVIDIA 风投部门)、Hallwood Media、Lightspeed 和 Matrix 参投。过去两年近 1 亿人在 Suno 上创作过音乐,公司称将用新资金为专业音乐人开发更复杂的工具、改善休闲创作者体验,并建设音乐社交与分享生态。
推荐理由:官方公告给出融资金额、估值和投资方名单,并说明资金将投向专业工具与社交功能的扩展方向。
Microsoft AI News精选AI 评分7373 Microsoft AI 发布 MAI-Voice-1 语音模型并开始公测 MAI-1-preview
Microsoft AI(MAI)发布两款自研模型:语音生成模型 MAI-Voice-1 已用于 Copilot Daily 和 Podcasts,并上线 Copilot Labs 体验。
推荐理由:Microsoft AI 官方公布两款自研模型的训练规模、使用入口与后续路线,读者可了解其自研模型布局。
Mistral AI精选AI 评分6161 Mistral AI 为 Le Chat 推出 Deep Research、语音、Projects 等多项新功能
Mistral AI 为 Le Chat 推出一批新功能,包括 Deep Research 预览模式、基于 Voxtral 的语音模式、由 Magistral 驱动的多语言推理、Projects 项目整理功能,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 官方一次性列出五项新功能及其支撑模型,读者可以对照了解 Le Chat 在研究和多模态方向的能力变化。
Mistral AI精选AI 评分7272 Mistral 发布语音理解模型 Voxtral,24B 与 3B 双版本采用 Apache 2.0 开源
Mistral AI 发布语音理解模型 Voxtral,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API。
推荐理由:官方给出完整基准对比和定价细节,开源语音模型在准确率与成本上的位置可以直接对比判断。
Suno Blog精选AI 评分6868 Suno 升级 Song Editor 并支持 8 分钟音频上传与 12 轨 stems 分离
Suno 发布一组创作控制功能:升级版 Song Editor 可在波形上逐段重排、改写和重制曲目,并可将曲目拆分为 12 条干净 stems(人声、鼓、贝斯等)预览和下载。音频上传扩展至最长 8 分钟,可从自己的完整曲目或吉他 riff 开始创作,另新增三个创意滑杆控制生成风格,支持导出后在 DAW 中继续编辑。
推荐理由:原文列出了 Song Editor、stems 分离和上传上限等具体能力,读者可以对照自己现有的创作流程判断是否用得上。
Suno Blog精选AI 评分6464 Suno 发布 v4.5 音乐生成模型
Suno 发布最新音乐生成模型 v4.5,曲风选项大幅扩充且更贴合描述,人声情感与音域增强,歌曲最长可达 8 分钟。新增提示词增强助手,Covers 与 Personas 可组合使用,生成速度与音频质量也有明显提升。
推荐理由:官方公告列出了 v4.5 在曲风、人声、音质和生成速度上的具体改进,音乐创作工作流的变化可以直接对照查看。