Gemini Live API 关停 gemini-2.0-flash-live-001 与 gemini-live-2.5-flash-preview
Gemini Live API 关停 gemini-2.0-flash-live-001 和 gemini-live-2.5-flash-preview 两款模型。此次调整来自 Gemini API 更新日志,涉及 Gemini 实时语音交互接口的模型可用性变更。
媒体报道、公司博客与研究文章
Gemini Live API 关停 gemini-2.0-flash-live-001 和 gemini-live-2.5-flash-preview 两款模型。此次调整来自 Gemini API 更新日志,涉及 Gemini 实时语音交互接口的模型可用性变更。
Gemini 3 的 Grounding with Google Search 功能将于 2026 年 1 月 5 日开始计费。该功能此前可免费使用,计费启动后相关调用将产生费用。
Mistral 发布新一代模型系列 Mistral 3,包括 14B/8B/3B 的 Ministral 3 小模型和 sparse MoE 架构的 Mistral Large 3(41B 激活、675B 总参数),全部以 Apache 2.0 许可开源,提供 base、instruct 和 reasoning 变体。
推荐理由:官方公布完整模型规格、开源许可和部署路径,读者可据此评估在自建或端侧场景的可用性。
DeepSeek 宣布 API 的 deepseek-chat 和 deepseek-reasoner 均已升级为 DeepSeek-V3.2。deepseek-chat 对应非思考模式,deepseek-reasoner 对应思考模式。
推荐理由:官方说明了两条 API 模型线与 DeepSeek-V3.2 思考模式的对应关系,方便使用 API 的开发者确认升级后的调用变化。
DeepSeek 非正式部署 DeepSeek-V3.2-Speciale API 服务,用户通过 base_url="https://api.deepseek.com/v3.2_speciale_expires_on_20251215" 访问。价格不变,仅支持思考模式下的对话功能,不支持工具调用,最大输出长度默认 128K,支持至北京时间 2025-12-15 23:59。
推荐理由:原文给出了非正式部署的访问方式和明确截止时间,用户可以据此判断是否短期试用这个思考模式模型。
Suno 宣布与 Warner Music Group(WMG)达成新合作,将用高质量授权音乐训练新一代模型,称其将超越目前最好的 v5。WMG 艺人可自愿授权姓名、形象、声音和作品用于 AI 生成音乐并获得新收入;未来下载歌曲需付费账号,各付费档位含每月下载额度,Suno Studio 保持不变并保留无限下载。
推荐理由:Suno 官方说明与 Warner Music Group 合作后的产品变化,包括付费下载门槛和授权模型计划,读者可据此调整使用方式。
Mistral AI 宣布通过多项长期战略承诺扩展在德国的业务。其中与 SAP 建立多年期合作,将 Mistral 模型集成到 SAP AI Foundation,为德国和欧洲提供完全主权 AI 堆栈并共同开发面向复杂行业和行政机构的行业解决方案;与 Helsing 加速开发面向国防和安全应用的视觉-语言-动作模型。Mistral 还计划大幅增加德国本地团队,并在未来几个月开设德国办公室。
Suno 宣布完成 2.5 亿美元 Series C 融资,投后估值 24.5 亿美元,由 Menlo Ventures 领投,NVentures(NVIDIA 风投部门)、Hallwood Media、Lightspeed 和 Matrix 参投。过去两年近 1 亿人在 Suno 上创作过音乐,公司称将用新资金为专业音乐人开发更复杂的工具、改善休闲创作者体验,并建设音乐社交与分享生态。
推荐理由:官方公告给出融资金额、估值和投资方名单,并说明资金将投向专业工具与社交功能的扩展方向。
Linear 客户体验团队将 Intercom、Slack、X、Reddit 等渠道的客户反馈通过 Linear-Intercom 集成和 Linear Asks 模板转为 Linear issue,分别进入工程与产品 triage 队列。
Microsoft AI 发布长文,提出 Humanist Superintelligence(HSI)理念,即面向具体领域、受控服务于人类的超智能,并宣布组建由作者领导的 MAI Superintelligence Team。
推荐理由:Microsoft AI 提出以人类为中心、领域受限的超智能路线,文中给出医疗诊断等具体方向和 containment 难题的判断。
伯克利 AI 研究提出一种基于分治(divide and conquer)范式的 off-policy 强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到任意长时程任务。
Linear 推出持续规划(continuous planning)流程,让产品团队在想法到来时即整理为候选项目,而非每季度面对空白页重新规划。2025 年起该流程引入 AI 维护项目,智能分诊建议可识别新需求是否与现有 issue 重复或归属同一项目。
Thinking Machines Lab 发布关于在线策略蒸馏(On-Policy Distillation)的研究:从学生模型采样轨迹,由教师模型逐 token 计算反向 KL 作为密集奖励,结合 RL 的在线策略相关性与蒸馏的密集信号。
推荐理由:Thinking Machines 亲自实验并给出复现代码,读者可以据此评估这种训练方法在自己场景下的成本收益。
MiniMax 开源并发布面向 Agent 和编码场景的模型 MiniMax M2,API 定价为每百万输入 tokens $0.30/¥2.1、输出 $1.20/¥8.4,为 Claude 4.5 Sonnet 的 8%,推理速度接近其两倍,TPS 约 100。
推荐理由:官方给出了 M2 的定价、推理速度、基准成绩与部署方式,读者可据此评估其在 Agent 工作流中的成本与性能权衡。
Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,包含 Observability、Agent Runtime 和 AI Registry 三大支柱。
Linear 发布官方文章提出“自动驾驶 SaaS”愿景,认为真正变革在于 AI 主动推进工作,而非在旧系统上加聊天机器人。文章类比自动驾驶分级描述三种自主级别,从建议分配 issue 到规则自动执行,再到 coding agent 全程处理特定类别 issue,并称这已是 Linear 的产品方向。
Microsoft AI 于 2025 年 10 月 13 日宣布 MAI-Image 1,这是其首个完全在内部开发的图像生成模型,首日进入 LMArena 文生图模型前十。
推荐理由:微软首次完全自研的图像生成模型,官方说明了训练重点、擅长场景和后续落地产品,可了解其定位与可用入口。
Sam Altman 宣布 Sora 将进行两项调整:一是给版权方更细粒度的角色生成控制,类似肖像的 opt-in 模式,并特别提到用户与日本内容的深度连接;二是因用户视频生成量超出预期,计划很快开始与希望其角色被生成的版权方分享部分收入。他表示具体模式仍需试错,Sora 的迭代速度会很高,类似 ChatGPT 早期。
推荐理由:原文给出版权方控制机制和视频生成收入分享两项具体调整方向,读者可以据此了解 Sora 的治理与商业模式走向。
OpenAI 发布 Sora 应用,结合新视频模型 Sora 2,提供视频创作、分享和观看功能,并支持把用户和朋友放入视频的 cameo 特性。团队已部署深度伪造防范、有害内容防护和用户情绪定期检查等缓解措施,并提出优化长期用户满意度、让用户控制 feed、优先创作和帮助长期目标四项产品原则。
推荐理由:原文来自当事方,给出了产品定位、cameo 功能和防沉迷设计原则,读者可据此判断其与常见短视频产品的差异。
Thinking Machines Lab 发布 John Schulman 署名的研究,发现在满足两个条件时 LoRA 的样本效率与最终性能与全量微调相当:一是应用于全部权重层尤其是 MLP/MoE 层,二是不受容量限制即数据集规模不超过 LoRA 参数容量。
推荐理由:原文系统实验给出 LoRA 追平全量微调的两个条件和最优学习率为其 10 倍等可操作结论,可直接指导微调选型。
deepseek-chat 和 deepseek-reasoner 均已升级为 DeepSeek-V3.2-Exp。deepseek-chat 对应该模型非思考模式,deepseek-reasoner 对应思考模式,详细更新内容需参阅官方文档。
推荐理由:官方说明两个 API 端点均已切换至新实验版模型,读后可据此确认调用行为是否受影响。
Thinking Machines Lab 提出将神经网络各层权重矩阵约束在子流形上的思路,并给出权重约束在 Stiefel 流形(单位条件数矩阵流形)上的 Muon 优化器版本。文章还提出"模块化流形"概念,即一种可组合流形,目标是让大规模网络的扩展与训练更简单,并梳理了该方向的未来研究空间。
Suno 宣布推出 Suno Studio,定位为生成式音频工作站,将 AI 生成融入音乐创作流程。它支持即时生成人声、鼓、合成器等无限 stem 变体,提供多轨时间线编辑、BPM、音量和音高控制,并可将 stem 导出为音频和 MIDI 文件回到任意 DAW。Suno Studio 已在桌面端面向 Premier 用户开放。
Sam Altman 提出"丰裕智能"愿景,计划打造一座每周能产出 1 吉瓦新增 AI 基础设施的工厂,并称这一目标需要数年、依赖从芯片到电力、建筑、机器人等全栈创新。他举例称 10 吉瓦算力或可用于攻克癌症或为全球每个学生提供定制辅导,并透露未来数月将公布相关计划与合作方,今年晚些时候公布融资方式。
DeepSeek 官方宣布 deepseek-chat 和 deepseek-reasoner 均已升级为 DeepSeek-V3.1-Terminus,分别对应其非思考模式和思考模式。此次更新保持模型原有能力,针对用户反馈改进了语言一致性,缓解中英文混杂和偶发异常字符问题,并优化了 Code Agent 与 Search Agent 的表现。
推荐理由:官方说明升级后的接口对应关系和两类具体改进,现有用户可据此判断是否切换或观察效果。
Thinking Machines Lab 发文指出,LLM 推理不确定性的主因不是并发与浮点加法,而是服务器负载变化导致批大小改变,使缺乏批不变性的内核产生不同数值结果。
推荐理由:原文指出 LLM 推理不确定性的真正来源是批大小变化破坏了批不变性,并给出可实现确定性推理的内核方案与代码。
Arvind Narayanan 撰文澄清《AI as Normal Technology》的核心论点:AI 能力提升与社会影响之间存在长因果链,收益和风险在部署而非研发阶段实现,政策重点应是韧性和部署环节。
Mistral AI 宣布完成 1.7B€ C 轮融资,投后估值 11.7B€,由 ASML 领投,DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 和 NVIDIA 参投。
推荐理由:官方原文给出融资金额、估值和 ASML 领投的战略合作细节,可了解这笔资金将投向工业级定制 AI 方案。
Sam Altman 发文致敬 OpenAI 首席科学家 Jakub Pachocki 与 Szymon Sidor,称没有他们就没有今天的 OpenAI。两人在业界普遍认为 RL 难以扩展时率先将其作为基线放大,促成 Dota 成果,搭建了支撑多项科学发现的基础设施,并主导 GPT-4 预训练,还与 Ilya、Lukasz 共同推动了推理能力的突破。
Linear 复盘上月推出的 Triage Intelligence 的构建过程,该功能用搜索、排序和 LLM 推理为新 issue 标记重复、关联相关 issue,并推荐标签或负责人等属性。
Mistral AI 在 Le Chat 中推出 Memories(beta)记忆功能,采用自动保存与智能、可见召回结合的混合方案。功能强调三大原则:透明(显示记忆来源与相关性)、可控(可关闭、开启无痕聊天、编辑或删除单条记忆)、可移植(支持导出和导入)。
Mistral AI 为 Le Chat 发布 20+ 个 MCP 驱动的安全连接器(beta)和 Memories(beta)记忆功能。
伯克利 AI 研究团队发表新论文,首次给出 word2vec 学习过程的定量预测理论:在现实实用条件下,其学习问题可归约为无权重最小二乘矩阵分解,梯度流动态有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。从小初始化训练时,word2vec 按离散步骤逐次学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征即 M* 的顶部特征向量,可由语料统计和超参数预先算出。
Microsoft AI(MAI)发布两款自研模型:语音生成模型 MAI-Voice-1 已用于 Copilot Daily 和 Podcasts,并上线 Copilot Labs 体验。
推荐理由:Microsoft AI 官方公布两款自研模型的训练规模、使用入口与后续路线,读者可了解其自研模型布局。
Linear 宣布新的 Cursor 集成,用户可以像指派给队友一样把 issue 直接分配给 Cursor agents。Cursor agents 可承接编码任务、开启 pull request 并把进度同步回 Linear。
DeepSeek 宣布 deepseek-chat 和 deepseek-reasoner 均升级为 DeepSeek-V3.1,分别对应其非思考模式与思考模式。
推荐理由:官方说明了两个 API 端点对应的模式切换,并给出 SWE-bench 等三项基准分数,读者可据此评估升级影响。
Linear 介绍其 Agent Interaction SDK 的构建思路:通过 OAuth 的 actor=app 模式让 Agent 成为工作区内的一等用户,新增 app:assignable 和 app:mentionable 两个可选权限控制 Agent 能否被指派或提及。
Mistral 用 LoRA 微调 Pixtral-12B 处理卫星图像,在 Aerial Image Dataset(AID)上显著优于基座模型。基座模型在 Playground 与 Stadium 等模糊类别上易混淆,甚至幻觉出不存在的类别名,微调后分类更准确。微调通过 Mistral 微调 API 或 LaPlateforme UI 完成,无需大量超参数调优。
Mistral AI 发布 Codestral 25.08,并整合 Codestral Embed、Devstral 和 Mistral Code IDE 插件形成企业级完整编码栈,覆盖云、VPC 和本地部署。
Mistral AI 联合 Carbone 4 和法国生态转型署 ADEME 完成首个针对大模型的全生命周期环境评估。