Gemini Live API 关停 gemini-2.0-flash-live-001 与 gemini-live-2.5-flash-preview
Gemini Live API 关停 gemini-2.0-flash-live-001 和 gemini-live-2.5-flash-preview 两款模型。此次调整来自 Gemini API 更新日志,涉及 Gemini 实时语音交互接口的模型可用性变更。
媒体报道、公司博客与研究文章
Gemini Live API 关停 gemini-2.0-flash-live-001 和 gemini-live-2.5-flash-preview 两款模型。此次调整来自 Gemini API 更新日志,涉及 Gemini 实时语音交互接口的模型可用性变更。
千问(Qwen)提出 SAPO,一种用于训练大语言模型的稳定且高性能的强化学习方法。该方法针对实践中基于组的策略优化——即每个提示词采样多个回答并在组内归一化奖励——进行改进。
千问 Qwen3-TTS-Flash 旗舰语音合成模型更新,支持 49 种以上高品质音色、10 种语言和 9 种方言,覆盖不同性别、年龄、地域特征与角色设定。该模型可通过 Qwen API 调用,主打自然且富有表现力的语音合成。
Gemini 3 的 Grounding with Google Search 功能将于 2026 年 1 月 5 日开始计费。该功能此前可免费使用,计费启动后相关调用将产生费用。
Toyota 北加州经销商协会与创意机构 H/L 基于 ElevenLabs Agents 平台,推出由 AI 语音版 49ers 四分卫 Brock Purdy 主持的语音问答互动体验,落地页为 toyotaletsgo.com/brock-purdy。
Mistral 发布新一代模型系列 Mistral 3,包括 14B/8B/3B 的 Ministral 3 小模型和 sparse MoE 架构的 Mistral Large 3(41B 激活、675B 总参数),全部以 Apache 2.0 许可开源,提供 base、instruct 和 reasoning 变体。
推荐理由:官方公布完整模型规格、开源许可和部署路径,读者可据此评估在自建或端侧场景的可用性。
DeepSeek 宣布 API 的 deepseek-chat 和 deepseek-reasoner 均已升级为 DeepSeek-V3.2。deepseek-chat 对应非思考模式,deepseek-reasoner 对应思考模式。
推荐理由:官方说明了两条 API 模型线与 DeepSeek-V3.2 思考模式的对应关系,方便使用 API 的开发者确认升级后的调用变化。
DeepSeek 非正式部署 DeepSeek-V3.2-Speciale API 服务,用户通过 base_url="https://api.deepseek.com/v3.2_speciale_expires_on_20251215" 访问。价格不变,仅支持思考模式下的对话功能,不支持工具调用,最大输出长度默认 128K,支持至北京时间 2025-12-15 23:59。
推荐理由:原文给出了非正式部署的访问方式和明确截止时间,用户可以据此判断是否短期试用这个思考模式模型。
Suno 宣布与 Warner Music Group(WMG)达成新合作,将用高质量授权音乐训练新一代模型,称其将超越目前最好的 v5。WMG 艺人可自愿授权姓名、形象、声音和作品用于 AI 生成音乐并获得新收入;未来下载歌曲需付费账号,各付费档位含每月下载额度,Suno Studio 保持不变并保留无限下载。
推荐理由:Suno 官方说明与 Warner Music Group 合作后的产品变化,包括付费下载门槛和授权模型计划,读者可据此调整使用方式。
ElevenLabs 与 Liberty Global Ventures 达成商业合作,后者将对其进行战略投资,双方聚焦语音 AI 在电信与娱乐产品中的落地,包括 AI 客服智能体和联网电视、流媒体语音交互界面。该投资由 Liberty Global Ventures 合伙人 Rebecca Hunt 主导,将支持 ElevenLabs 在全球扩展其基础语音模型。
Mistral AI 宣布通过多项长期战略承诺扩展在德国的业务。其中与 SAP 建立多年期合作,将 Mistral 模型集成到 SAP AI Foundation,为德国和欧洲提供完全主权 AI 堆栈并共同开发面向复杂行业和行政机构的行业解决方案;与 Helsing 加速开发面向国防和安全应用的视觉-语言-动作模型。Mistral 还计划大幅增加德国本地团队,并在未来几个月开设德国办公室。
Suno 宣布完成 2.5 亿美元 Series C 融资,投后估值 24.5 亿美元,由 Menlo Ventures 领投,NVentures(NVIDIA 风投部门)、Hallwood Media、Lightspeed 和 Matrix 参投。过去两年近 1 亿人在 Suno 上创作过音乐,公司称将用新资金为专业音乐人开发更复杂的工具、改善休闲创作者体验,并建设音乐社交与分享生态。
推荐理由:官方公告给出融资金额、估值和投资方名单,并说明资金将投向专业工具与社交功能的扩展方向。
ElevenLabs 发布 Image & Video(Beta),在单一平台内整合图像与视频生成能力。可使用 Veo、Sora、Kling、Wan、Seedance 等模型生成视频,用 Nanobanana、Flux Kontext、GPT Image、Seedream 生成图像,并支持放大和用 ElevenLabs 语音添加 lipsync。
推荐理由:官方发布介绍了平台内聚合多家视频与图像模型并接续语音制作的完整流程,读者可以据此评估能否把现有分散的创作环节合并到一处。
Qwen 团队发布 Qwen DeepResearch,并提供了在线体验入口。原文以灵感常因成本考量而搁置为引子展开,正文在来源中仅有开头片段,更多细节未完整呈现。
ElevenLabs 与 AI 法律平台 Harvey 达成合作,基于 ElevenLabs 的 Text to Speech 和 Speech to Text 技术,为法律行业打造首个全球多语言语音能力,让 Harvey 能以数十种语言、方言和口音自然交流。第一阶段 Harvey 将支持以几乎任意语言或方言语音输出答案,后续将推出多语言语音翻译、语音模式、模拟庭审语音、语气定制等功能。
ElevenLabs 在首届 Summit 上宣布,奥斯卡影帝 Matthew McConaughey 已作为投资人、早期支持者参与公司多年,如今还成为创作者。他的 newsletter《Lyrics of Livin'》将借助 ElevenLabs 推出西班牙语版本,用他本人的声音生成西班牙语音频内容,触达更广受众。
ElevenLabs 发布实时语音转文字模型 Scribe v2 Realtime,延迟低于 150 ms,支持英语、法语、德语、意大利语、西班牙语、葡萄牙语及共 90 种语言,在 30 种欧洲和亚洲语言上达到 93.5% 准确率。模型面向语音智能体等实时场景,提供负延迟预测、自动语言检测、VAD、多音频格式支持,已通过 API 和 ElevenLabs Agents 开放使用。
ElevenLabs 推出 Iconic Marketplace,一个面向企业授权名人声音的双边平台,Sir Michael Caine 已入驻,平台目前上线超过 25 位标志性声音,包括 Dr. Maya Angelou、Alan Turing、Liza Minelli 和 Art Garfunkel。
Linear 客户体验团队将 Intercom、Slack、X、Reddit 等渠道的客户反馈通过 Linear-Intercom 集成和 Linear Asks 模板转为 Linear issue,分别进入工程与产品 triage 队列。
Microsoft AI 发布长文,提出 Humanist Superintelligence(HSI)理念,即面向具体领域、受控服务于人类的超智能,并宣布组建由作者领导的 MAI Superintelligence Team。
推荐理由:Microsoft AI 提出以人类为中心、领域受限的超智能路线,文中给出医疗诊断等具体方向和 containment 难题的判断。
ElevenLabs 访问基辅,与乌克兰数字转型部长 Mykhailo Fedorov 签署谅解备忘录,将 AI 公共服务从概念推向生产。
伯克利 AI 研究提出一种基于分治(divide and conquer)范式的 off-policy 强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到任意长时程任务。
Linear 推出持续规划(continuous planning)流程,让产品团队在想法到来时即整理为候选项目,而非每季度面对空白页重新规划。2025 年起该流程引入 AI 维护项目,智能分诊建议可识别新需求是否与现有 issue 重复或归属同一项目。
Thinking Machines Lab 发布关于在线策略蒸馏(On-Policy Distillation)的研究:从学生模型采样轨迹,由教师模型逐 token 计算反向 KL 作为密集奖励,结合 RL 的在线策略相关性与蒸馏的密集信号。
推荐理由:Thinking Machines 亲自实验并给出复现代码,读者可以据此评估这种训练方法在自己场景下的成本收益。
MiniMax 开源并发布面向 Agent 和编码场景的模型 MiniMax M2,API 定价为每百万输入 tokens $0.30/¥2.1、输出 $1.20/¥8.4,为 Claude 4.5 Sonnet 的 8%,推理速度接近其两倍,TPS 约 100。
推荐理由:官方给出了 M2 的定价、推理速度、基准成绩与部署方式,读者可据此评估其在 Agent 工作流中的成本与性能权衡。
Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,包含 Observability、Agent Runtime 和 AI Registry 三大支柱。
Linear 发布官方文章提出“自动驾驶 SaaS”愿景,认为真正变革在于 AI 主动推进工作,而非在旧系统上加聊天机器人。文章类比自动驾驶分级描述三种自主级别,从建议分配 issue 到规则自动执行,再到 coding agent 全程处理特定类别 issue,并称这已是 Linear 的产品方向。
Microsoft AI 于 2025 年 10 月 13 日宣布 MAI-Image 1,这是其首个完全在内部开发的图像生成模型,首日进入 LMArena 文生图模型前十。
推荐理由:微软首次完全自研的图像生成模型,官方说明了训练重点、擅长场景和后续落地产品,可了解其定位与可用入口。
ElevenLabs 的 Agents 平台推出 Agent Workflows,一个用于设计对话流的可视化编辑器,可将复杂场景路由给专门的 Subagents,并按需转接人工。每个 Subagent 拥有独立的系统提示词、工具和限定范围的知识库,可嵌入业务规则与受控凭证,并支持按步骤选择不同 LLM,以降低 token 用量和延迟、提升准确性。
Sam Altman 宣布 Sora 将进行两项调整:一是给版权方更细粒度的角色生成控制,类似肖像的 opt-in 模式,并特别提到用户与日本内容的深度连接;二是因用户视频生成量超出预期,计划很快开始与希望其角色被生成的版权方分享部分收入。他表示具体模式仍需试错,Sora 的迭代速度会很高,类似 ChatGPT 早期。
推荐理由:原文给出版权方控制机制和视频生成收入分享两项具体调整方向,读者可以据此了解 Sora 的治理与商业模式走向。
OpenAI 发布 Sora 应用,结合新视频模型 Sora 2,提供视频创作、分享和观看功能,并支持把用户和朋友放入视频的 cameo 特性。团队已部署深度伪造防范、有害内容防护和用户情绪定期检查等缓解措施,并提出优化长期用户满意度、让用户控制 feed、优先创作和帮助长期目标四项产品原则。
推荐理由:原文来自当事方,给出了产品定位、cameo 功能和防沉迷设计原则,读者可据此判断其与常见短视频产品的差异。
Thinking Machines Lab 发布 John Schulman 署名的研究,发现在满足两个条件时 LoRA 的样本效率与最终性能与全量微调相当:一是应用于全部权重层尤其是 MLP/MoE 层,二是不受容量限制即数据集规模不超过 LoRA 参数容量。
推荐理由:原文系统实验给出 LoRA 追平全量微调的两个条件和最优学习率为其 10 倍等可操作结论,可直接指导微调选型。
deepseek-chat 和 deepseek-reasoner 均已升级为 DeepSeek-V3.2-Exp。deepseek-chat 对应该模型非思考模式,deepseek-reasoner 对应思考模式,详细更新内容需参阅官方文档。
推荐理由:官方说明两个 API 端点均已切换至新实验版模型,读后可据此确认调用行为是否受影响。
Thinking Machines Lab 提出将神经网络各层权重矩阵约束在子流形上的思路,并给出权重约束在 Stiefel 流形(单位条件数矩阵流形)上的 Muon 优化器版本。文章还提出"模块化流形"概念,即一种可组合流形,目标是让大规模网络的扩展与训练更简单,并梳理了该方向的未来研究空间。
Suno 宣布推出 Suno Studio,定位为生成式音频工作站,将 AI 生成融入音乐创作流程。它支持即时生成人声、鼓、合成器等无限 stem 变体,提供多轨时间线编辑、BPM、音量和音高控制,并可将 stem 导出为音频和 MIDI 文件回到任意 DAW。Suno Studio 已在桌面端面向 Premier 用户开放。
Sam Altman 提出"丰裕智能"愿景,计划打造一座每周能产出 1 吉瓦新增 AI 基础设施的工厂,并称这一目标需要数年、依赖从芯片到电力、建筑、机器人等全栈创新。他举例称 10 吉瓦算力或可用于攻克癌症或为全球每个学生提供定制辅导,并透露未来数月将公布相关计划与合作方,今年晚些时候公布融资方式。
DeepSeek 官方宣布 deepseek-chat 和 deepseek-reasoner 均已升级为 DeepSeek-V3.1-Terminus,分别对应其非思考模式和思考模式。此次更新保持模型原有能力,针对用户反馈改进了语言一致性,缓解中英文混杂和偶发异常字符问题,并优化了 Code Agent 与 Search Agent 的表现。
推荐理由:官方说明升级后的接口对应关系和两类具体改进,现有用户可据此判断是否切换或观察效果。
Thinking Machines Lab 发文指出,LLM 推理不确定性的主因不是并发与浮点加法,而是服务器负载变化导致批大小改变,使缺乏批不变性的内核产生不同数值结果。
推荐理由:原文指出 LLM 推理不确定性的真正来源是批大小变化破坏了批不变性,并给出可实现确定性推理的内核方案与代码。
Arvind Narayanan 撰文澄清《AI as Normal Technology》的核心论点:AI 能力提升与社会影响之间存在长因果链,收益和风险在部署而非研发阶段实现,政策重点应是韧性和部署环节。
Mistral AI 宣布完成 1.7B€ C 轮融资,投后估值 11.7B€,由 ASML 领投,DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 和 NVIDIA 参投。
推荐理由:官方原文给出融资金额、估值和 ASML 领投的战略合作细节,可了解这笔资金将投向工业级定制 AI 方案。