Sierra 在巴黎设立新团队
Sierra 宣布在巴黎设立新团队,这是继伦敦、新加坡、东京之后的新办公地点。Sierra 表示将帮助法国航空航天、能源和奢侈品等行业的企业用 AI 打造更人性化的客户体验,并正在当地招聘。
媒体报道、公司博客与研究文章
Sierra 宣布在巴黎设立新团队,这是继伦敦、新加坡、东京之后的新办公地点。Sierra 表示将帮助法国航空航天、能源和奢侈品等行业的企业用 AI 打造更人性化的客户体验,并正在当地招聘。
Gemini 发布 gemini-2.5-flash-native-audio-preview-12-2025,这是面向 Live API 的新原生音频模型,提升了处理复杂工作流的能力。用户可查阅 Live API 指南和 Gemini 2.5 Flash Native Audio 了解详情。
Gemini API 发布 Interactions API,为 Gemini 模型和智能体提供统一交互接口。同时上线 Gemini Deep Research 智能体预览版,可自主规划、执行并综合多步骤研究任务的结果。
Microsoft AI 发布《Copilot 使用报告 2025》,基于 3750 万次对话的脱敏摘要数据分析了用户的真实使用模式。健康类话题在移动端全年居首,2 月情人节前后关系类对话明显激增,编程与游戏话题在 8 月出现交叉——工作日偏编程、周末偏游戏。报告还发现凌晨时段宗教与哲学类对话排名上升,且用户寻求个人建议的对话占比持续增长。
Sierra 发布 Visual Attachments,让聊天智能体在对话中直接嵌入进度条、安全输入框、庆祝卡片等可视化 UI 组件。这些组件用 React 构建,可在 Agent Studio 中无代码部署,并支持无障碍、响应式与效果度量。Rocket Mortgage 的预资格智能体采用后,客户转接银行专员时的转化率在再融资和购房流程中均提升 4 倍。
Gemini 2.5 Flash TTS 和 Gemini 2.5 Pro TTS 预览版迎来增强,前者针对低延迟优化,后者针对质量优化。此次更新提升了表现力、精确节奏控制和无缝对话能力。
Mistral 发布开源编码模型 Devstral 2(123B,修改版 MIT)和 Devstral Small 2(24B,Apache 2.0),SWE-bench Verified 分别达 72.2% 和 68.0%,均支持 256K 上下文。
推荐理由:官方给出了两个尺寸的开源编码模型参数量、SWE-bench Verified 成绩、API 定价和部署门槛,可与闭源竞品直接对比。
Qwen 发布 Qwen3-Omni,称其为新一代原生多模态大模型,可处理文本、图像、音频、视频输入,并通过实时流式响应同时生成文本和自然语音输出。
Gemini Live API 关停 gemini-2.0-flash-live-001 和 gemini-live-2.5-flash-preview 两款模型。此次调整来自 Gemini API 更新日志,涉及 Gemini 实时语音交互接口的模型可用性变更。
千问(Qwen)提出 SAPO,一种用于训练大语言模型的稳定且高性能的强化学习方法。该方法针对实践中基于组的策略优化——即每个提示词采样多个回答并在组内归一化奖励——进行改进。
千问 Qwen3-TTS-Flash 旗舰语音合成模型更新,支持 49 种以上高品质音色、10 种语言和 9 种方言,覆盖不同性别、年龄、地域特征与角色设定。该模型可通过 Qwen API 调用,主打自然且富有表现力的语音合成。
Gemini 3 的 Grounding with Google Search 功能将于 2026 年 1 月 5 日开始计费。该功能此前可免费使用,计费启动后相关调用将产生费用。
Toyota 北加州经销商协会与创意机构 H/L 基于 ElevenLabs Agents 平台,推出由 AI 语音版 49ers 四分卫 Brock Purdy 主持的语音问答互动体验,落地页为 toyotaletsgo.com/brock-purdy。
Mistral 发布新一代模型系列 Mistral 3,包括 14B/8B/3B 的 Ministral 3 小模型和 sparse MoE 架构的 Mistral Large 3(41B 激活、675B 总参数),全部以 Apache 2.0 许可开源,提供 base、instruct 和 reasoning 变体。
推荐理由:官方公布完整模型规格、开源许可和部署路径,读者可据此评估在自建或端侧场景的可用性。
DeepSeek 宣布 API 的 deepseek-chat 和 deepseek-reasoner 均已升级为 DeepSeek-V3.2。deepseek-chat 对应非思考模式,deepseek-reasoner 对应思考模式。
推荐理由:官方说明了两条 API 模型线与 DeepSeek-V3.2 思考模式的对应关系,方便使用 API 的开发者确认升级后的调用变化。
DeepSeek 非正式部署 DeepSeek-V3.2-Speciale API 服务,用户通过 base_url="https://api.deepseek.com/v3.2_speciale_expires_on_20251215" 访问。价格不变,仅支持思考模式下的对话功能,不支持工具调用,最大输出长度默认 128K,支持至北京时间 2025-12-15 23:59。
推荐理由:原文给出了非正式部署的访问方式和明确截止时间,用户可以据此判断是否短期试用这个思考模式模型。
Suno 宣布与 Warner Music Group(WMG)达成新合作,将用高质量授权音乐训练新一代模型,称其将超越目前最好的 v5。WMG 艺人可自愿授权姓名、形象、声音和作品用于 AI 生成音乐并获得新收入;未来下载歌曲需付费账号,各付费档位含每月下载额度,Suno Studio 保持不变并保留无限下载。
推荐理由:Suno 官方说明与 Warner Music Group 合作后的产品变化,包括付费下载门槛和授权模型计划,读者可据此调整使用方式。
ElevenLabs 与 Liberty Global Ventures 达成商业合作,后者将对其进行战略投资,双方聚焦语音 AI 在电信与娱乐产品中的落地,包括 AI 客服智能体和联网电视、流媒体语音交互界面。该投资由 Liberty Global Ventures 合伙人 Rebecca Hunt 主导,将支持 ElevenLabs 在全球扩展其基础语音模型。
Mistral AI 宣布通过多项长期战略承诺扩展在德国的业务。其中与 SAP 建立多年期合作,将 Mistral 模型集成到 SAP AI Foundation,为德国和欧洲提供完全主权 AI 堆栈并共同开发面向复杂行业和行政机构的行业解决方案;与 Helsing 加速开发面向国防和安全应用的视觉-语言-动作模型。Mistral 还计划大幅增加德国本地团队,并在未来几个月开设德国办公室。
Suno 宣布完成 2.5 亿美元 Series C 融资,投后估值 24.5 亿美元,由 Menlo Ventures 领投,NVentures(NVIDIA 风投部门)、Hallwood Media、Lightspeed 和 Matrix 参投。过去两年近 1 亿人在 Suno 上创作过音乐,公司称将用新资金为专业音乐人开发更复杂的工具、改善休闲创作者体验,并建设音乐社交与分享生态。
推荐理由:官方公告给出融资金额、估值和投资方名单,并说明资金将投向专业工具与社交功能的扩展方向。
ElevenLabs 发布 Image & Video(Beta),在单一平台内整合图像与视频生成能力。可使用 Veo、Sora、Kling、Wan、Seedance 等模型生成视频,用 Nanobanana、Flux Kontext、GPT Image、Seedream 生成图像,并支持放大和用 ElevenLabs 语音添加 lipsync。
推荐理由:官方发布介绍了平台内聚合多家视频与图像模型并接续语音制作的完整流程,读者可以据此评估能否把现有分散的创作环节合并到一处。
Qwen 团队发布 Qwen DeepResearch,并提供了在线体验入口。原文以灵感常因成本考量而搁置为引子展开,正文在来源中仅有开头片段,更多细节未完整呈现。
ElevenLabs 与 AI 法律平台 Harvey 达成合作,基于 ElevenLabs 的 Text to Speech 和 Speech to Text 技术,为法律行业打造首个全球多语言语音能力,让 Harvey 能以数十种语言、方言和口音自然交流。第一阶段 Harvey 将支持以几乎任意语言或方言语音输出答案,后续将推出多语言语音翻译、语音模式、模拟庭审语音、语气定制等功能。
ElevenLabs 在首届 Summit 上宣布,奥斯卡影帝 Matthew McConaughey 已作为投资人、早期支持者参与公司多年,如今还成为创作者。他的 newsletter《Lyrics of Livin'》将借助 ElevenLabs 推出西班牙语版本,用他本人的声音生成西班牙语音频内容,触达更广受众。
ElevenLabs 发布实时语音转文字模型 Scribe v2 Realtime,延迟低于 150 ms,支持英语、法语、德语、意大利语、西班牙语、葡萄牙语及共 90 种语言,在 30 种欧洲和亚洲语言上达到 93.5% 准确率。模型面向语音智能体等实时场景,提供负延迟预测、自动语言检测、VAD、多音频格式支持,已通过 API 和 ElevenLabs Agents 开放使用。
ElevenLabs 推出 Iconic Marketplace,一个面向企业授权名人声音的双边平台,Sir Michael Caine 已入驻,平台目前上线超过 25 位标志性声音,包括 Dr. Maya Angelou、Alan Turing、Liza Minelli 和 Art Garfunkel。
Linear 客户体验团队将 Intercom、Slack、X、Reddit 等渠道的客户反馈通过 Linear-Intercom 集成和 Linear Asks 模板转为 Linear issue,分别进入工程与产品 triage 队列。
Microsoft AI 发布长文,提出 Humanist Superintelligence(HSI)理念,即面向具体领域、受控服务于人类的超智能,并宣布组建由作者领导的 MAI Superintelligence Team。
推荐理由:Microsoft AI 提出以人类为中心、领域受限的超智能路线,文中给出医疗诊断等具体方向和 containment 难题的判断。
ElevenLabs 访问基辅,与乌克兰数字转型部长 Mykhailo Fedorov 签署谅解备忘录,将 AI 公共服务从概念推向生产。
伯克利 AI 研究提出一种基于分治(divide and conquer)范式的 off-policy 强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到任意长时程任务。
Linear 推出持续规划(continuous planning)流程,让产品团队在想法到来时即整理为候选项目,而非每季度面对空白页重新规划。2025 年起该流程引入 AI 维护项目,智能分诊建议可识别新需求是否与现有 issue 重复或归属同一项目。
Thinking Machines Lab 发布关于在线策略蒸馏(On-Policy Distillation)的研究:从学生模型采样轨迹,由教师模型逐 token 计算反向 KL 作为密集奖励,结合 RL 的在线策略相关性与蒸馏的密集信号。
推荐理由:Thinking Machines 亲自实验并给出复现代码,读者可以据此评估这种训练方法在自己场景下的成本收益。
MiniMax 开源并发布面向 Agent 和编码场景的模型 MiniMax M2,API 定价为每百万输入 tokens $0.30/¥2.1、输出 $1.20/¥8.4,为 Claude 4.5 Sonnet 的 8%,推理速度接近其两倍,TPS 约 100。
推荐理由:官方给出了 M2 的定价、推理速度、基准成绩与部署方式,读者可据此评估其在 Agent 工作流中的成本与性能权衡。
Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,包含 Observability、Agent Runtime 和 AI Registry 三大支柱。
Linear 发布官方文章提出“自动驾驶 SaaS”愿景,认为真正变革在于 AI 主动推进工作,而非在旧系统上加聊天机器人。文章类比自动驾驶分级描述三种自主级别,从建议分配 issue 到规则自动执行,再到 coding agent 全程处理特定类别 issue,并称这已是 Linear 的产品方向。
Microsoft AI 于 2025 年 10 月 13 日宣布 MAI-Image 1,这是其首个完全在内部开发的图像生成模型,首日进入 LMArena 文生图模型前十。
推荐理由:微软首次完全自研的图像生成模型,官方说明了训练重点、擅长场景和后续落地产品,可了解其定位与可用入口。
ElevenLabs 的 Agents 平台推出 Agent Workflows,一个用于设计对话流的可视化编辑器,可将复杂场景路由给专门的 Subagents,并按需转接人工。每个 Subagent 拥有独立的系统提示词、工具和限定范围的知识库,可嵌入业务规则与受控凭证,并支持按步骤选择不同 LLM,以降低 token 用量和延迟、提升准确性。
Sam Altman 宣布 Sora 将进行两项调整:一是给版权方更细粒度的角色生成控制,类似肖像的 opt-in 模式,并特别提到用户与日本内容的深度连接;二是因用户视频生成量超出预期,计划很快开始与希望其角色被生成的版权方分享部分收入。他表示具体模式仍需试错,Sora 的迭代速度会很高,类似 ChatGPT 早期。
推荐理由:原文给出版权方控制机制和视频生成收入分享两项具体调整方向,读者可以据此了解 Sora 的治理与商业模式走向。
OpenAI 发布 Sora 应用,结合新视频模型 Sora 2,提供视频创作、分享和观看功能,并支持把用户和朋友放入视频的 cameo 特性。团队已部署深度伪造防范、有害内容防护和用户情绪定期检查等缓解措施,并提出优化长期用户满意度、让用户控制 feed、优先创作和帮助长期目标四项产品原则。
推荐理由:原文来自当事方,给出了产品定位、cameo 功能和防沉迷设计原则,读者可据此判断其与常见短视频产品的差异。
Thinking Machines Lab 发布 John Schulman 署名的研究,发现在满足两个条件时 LoRA 的样本效率与最终性能与全量微调相当:一是应用于全部权重层尤其是 MLP/MoE 层,二是不受容量限制即数据集规模不超过 LoRA 参数容量。
推荐理由:原文系统实验给出 LoRA 追平全量微调的两个条件和最优学习率为其 10 倍等可操作结论,可直接指导微调选型。