日本法院首例认定 AI 克隆声音侵犯形象权,声优津田健次郎起诉 TikTok 获部分支持
当地时间 9 月 30 日,东京一家法院在声优津田健次郎起诉 TikTok 的案件中认定,未经许可用 AI 模仿其男中音声线涉及权利侵害,首次在日本司法实践中确认人的声音受法律保护,并指出未经本人许可使用其声音应视为侵犯形象权。
当地时间 9 月 30 日,东京一家法院在声优津田健次郎起诉 TikTok 的案件中认定,未经许可用 AI 模仿其男中音声线涉及权利侵害,首次在日本司法实践中确认人的声音受法律保护,并指出未经本人许可使用其声音应视为侵犯形象权。
@suno 我觉得 Speech 这个名字不太合适。 叫 Vocal Booth 怎么样?
@suno Speech doesn’t feel right to me as the name for this. What about Vocal Booth?
微软于 10 月 1 日推出首个实时流式语音转写模型 MAI-Transcribe-2-Streaming,可在讲话进行时持续输出文字,支持 60 种语言和自动语言检测。
ElevenLabs 宣布通过 3 亿美元的 tender offer 让员工套现部分已归属股权,估值 220 亿美元,较今年 2 月融资 5 亿美元时的 110 亿美元估值翻倍。
https://suno.com/s/nLnF9DZvqyIFxi2u thanks we try really hard
speech + background music in one pass is the kind of thing that sounds trivial until you try to keep them temporally coherent. two generators fighting for the same timeline usually smear each other. if the music actually ducks, swells, and punctuates around the voice instead of being glued on after, that's a real step for realtime audio.
Your AI voice sounds human. So why can't it say your product's name? A great AI voice reads "Porsche Taycan" as TAY-can. Porsche says TIE-kahn. It guessed from the spelling, and nobody caught it, because nobody listens to line 1,200. Today we're launching Onepin: the production step after text-to-speech. It checks every line of voiceover before it ships using the voices you already work with. Onepin can: ➤ Check people's and product names against a 4-million-word pronunciation dictionary ➤ Spell out prices and dates before the voice speaks ➤ Score every line of audio for naturalness, clarity and word accuracy ➤ Fix the one wrong word in the same voice, without re-rendering the take Works with your voice subscription on @ElevenLabs, @OpenAI, @Google and 30+ more. No phonetic spellings to type. No re-rolls. No switching providers. Free to start, no credit card required. Hear the before and after in the thread ⬇️
Tavus 发布 Griffin,公司称其为首个面向实时面对面对话的 Human Interaction Model,可处理语音、表情、语调、手势和停顿并接收与生成视频。
Microsoft AI 发布实时流式转写模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 的最终与部分转写准确率均排名第一,支持 60 种语言,接收到音频后约 100ms 内产出首个 partials,内部评测显示实时听写场景出词速度比最接近的竞品快 2x,年底前 introductory 价 $0.54 每小时音频。
推荐理由:官方公布三款语音模型的具体定价、延迟数字和 Artificial Analysis 排名,可据此评估搭建语音智能体的成本与速度。
Suno 发布 Studio 2.0,用户可从一首歌开始,通过聊天栏完成分离 stems、添加新乐器、效果器和自动化操作。
Suno 发布 Speech 测试版,称其为首个能把语音和音乐作为一条完整音轨共同生成的音频模型。用户输入文字并描述声音与音乐风格,即可生成配有原创背景音乐的语音内容;此前已小范围测试一个月,现向所有用户开放,团队表示会持续改进。
推荐理由:原文说明了 Speech 将语音与音乐合成为一条轨道的玩法和开放范围,读者可据此判断它带来哪些新用途。
研究提出 Speaker Identified cpWER(SI-cpWER)指标,在单一全局说话人 ID 分配下评估跨会议持久说话人归属,覆盖 CHiME-8 NOTSOFAR 全部 129 场会议(干净与加噪两种形式)及 CHiME-6。
LEAP 通过将录音切分为固定时长块、用轻量定位阶段为每块候选窗口打分,再把高分窗口汇聚后单次有界重编码作答,使答案输入与峰值上下文不随录音时长增长。在多个 AVQA 基准上,LEAP 较 Qwen3-Omni-30B-A3B 基线提升 4.5-16.8%,迁移到 MiniCPM-o 4.5 后超出其已发表结果 3.1-13.0%。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源多语言 TTS 和语音克隆模型。指标包括基于 Qwen3 ASR 的 WER/CER、H200 上的 RTFx 和 TTFA 流式延迟、WavLM 嵌入的说话人相似度(SIM),把评估周期从数周缩短到数小时。
用 Suno Studio,你可以录下自己的声音,把它变成任何东西。 电吉他只是开始。
作者分享花费 10+ 小时摸索出的用 Opus 5.5 做视频生成的工作流:建议搭配 Claude Code 使用,用 OpenRouter API 一个密钥调用图像。
MiniCPM-o 4.5 现已支持 SGLang Omni v0.1.7。 为开发者提供更多灵活的运行和构建方式。
Hi everyone, today we released SGLang Omni v0.1.7. This release includes 75 merged PRs and welcomes 8 new contributors, with 8 first-time contributions. We added MiniCPM-o 4.5, NVIDIA PersonaPlex-7B, and OmniTyper powered by MLX streaming ASR, while further improving realtime and stateful Omni serving. 1.Performance: continued optimizations for Qwen3-TTS, Qwen3-Omni, CosyVoice3, MOSS-TTS, and AuK, covering Prefill CUDA Graph, speaker/reference encoding, kernel fusion, batching, and vocoder hot paths. 2.Serving: added Omni session lifecycle, the SGLang streaming session bridge, and a shared /v1/realtime WebSocket runtime, while further improving realtime ASR and streaming serving. 3.Models & hardware: added MiniCPM-o 4.5 multimodal input and speech output, plus PersonaPlex-7B offline speech-to-speech. MiniCPM-o and MiniMax-Music3 now support Intel XPU, with further MUSA support for Qwen3-TTS. 4.Runtime: improved breakable Prefill CUDA Graph, Talker / Code2Wav colocation, priority CUDA streams, scheduler admission, and profiling infrastructure to reduce host overhead and improve high-concurrency stability. https://github.com/sgl-project/sglang-omni/releases/tag/v0.1.7 https://github.com/sgl-project/sglang-omni
Tacit-TTS 是一个从 IndexTTS2 蒸馏而来的无转写零样本语音克隆系统,用掩码非自回归生成替代自回归文本到语义解码,并引入免训练声学长度估计与 ReFlow 蒸馏加速流匹配渲染器。在四个中英文数据集上,其对超过 5 秒的语句生成速度比 IndexTTS2 快 10 倍以上,同时保持有竞争力的零样本质量。无转写条件还支持跨语言及非词汇参考,如其他八种语言、婴儿咿呀声和合成乱语。
一篇综述将联合生成、跨模态生成与联合编辑统一形式化为音视频对分布上的三类问题,并提出沿五个设计轴比较方法的分类体系。该工作称首次系统梳理联合音视频编辑,将其划分为九类编辑、涵盖 28 种编辑类型,并整理了各设定的方法、数据集与指标。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为对话模型加入近实时视频生成与视觉形象,今日起在 Gemini Enterprise 提供。该功能支持精确唇形同步、异步工具调用不中断对话、跨 97 种语言的语音到语音同步,并可用参考图定制头像(需企业允许名单),所有输出带 SynthID 水印。
inclusionAI 发布 Ming-UniAudio-16B-A3B-Edit,统一语音理解、生成与编辑,核心是基于 VAE 和因果 Transformer 的连续语音分词器 MingTok-Audio,整合语义与声学特征。
inclusionAI 发布 Ming-UniAudio 框架及 Ming-UniAudio-16B-A3B 模型,统一语音理解、生成和编辑,核心是基于 VAE 与因果 Transformer 的连续语音 tokenizer MingTok-Audio。
Apple 研究团队提出潜空间蒸馏方法压缩流式神经音频编码器(tokenizer),以教师模型量化前的逐帧潜表示为监督目标,仅训练学生编码器做回归,并用单层仿射层吸收师生宽度差异。在 2.8 倍压缩下,六组师生配对中有五组无需微调即保持在教师 1.9% 相对 WER 以内,并比同容量独立训练编码器相对提升 3.9%。该方法同时适用于独立预训练和与语言模型联合训练的 tokenizer。
Apple 研究团队提出半监督联邦 ASR 训练方案,通过在线伪标签教师与服务端标注数据锚定更新两条耦合设计轴,解决伪标签误差跨序列、跨轮次累积导致的训练发散问题。该方案在 11 组对比中 9 组优于此前最强方法,域内平均提升 20.8%、跨域提升 10.0%,缩小了与全监督联邦学习的差距。
We heard you loud and clear. ChatGPT Voice can now: - Use plugins like your email, calendar, and Slack. - Be powered by GPT-6 Astra, Sol, and Luna. - Be used in ChatGPT Work on web and mobile, so you can create docs, decks, sites, and spreadsheets or tackle complex tasks in the browser, just by talking. Rolling out globally today in the latest version of the app.
推荐理由:原文列出了语音可用的插件类型和可用入口,读者可以据此判断日常语音助手工作流会有哪些变化。
作者宣布最新文本转语音与声音设计模型上线,现已在 AI Studio 中可用。新模型提供数千种可选声音,支持用提示词设计声音,可在 30 秒内复刻自己的声音,并提供表达性标签用于精细控制。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词设计角色声音、30 秒音频样本复刻声音,并逐行指挥表演。
推荐理由:原文给出两个 TTS 模型的定位差异、基准成绩和开放渠道,读者可据此评估语音生成工作流的选型。
inclusionAI(Venus Team,蚂蚁集团与清华大学)在 Hugging Face 开源 Realtime-Venus,包含基于 MiniCPM-o 4.5 的 9B 视听交互模型 Realtime-Venus-Omni 和纯音频模型 Realtime-Venus-Audio。
OpenAI 于 2026 年 7 月发布全双工语音模型 GPT-Live-1,可同时听和说,无需轮次检测器。