LMSYS 联合蚂蚁、美团等发布 SpecBundle(Phase 1)与 SpecForge v0.2
SpecForge 团队联合蚂蚁集团、美团、Nex-AGI 和 EigenAI 发布 SpecBundle(Phase 1),提供覆盖 8B 到 1T 参数主流 instruct 模型的生产级 EAGLE3 草稿模型权重,最高可达 4 倍端到端推理加速。
媒体报道、公司博客与研究文章
SpecForge 团队联合蚂蚁集团、美团、Nex-AGI 和 EigenAI 发布 SpecBundle(Phase 1),提供覆盖 8B 到 1T 参数主流 instruct 模型的生产级 EAGLE3 草稿模型权重,最高可达 4 倍端到端推理加速。
Linear 发文讨论“用代码做设计”之争,认为把设计等同于代码是过度简化,真正的问题是 AI 与新工具下设计师和工程师的角色如何演变,是否会出现“head of craft”这类新职位。文章主张先厘清问题本身再谈方案,并指出代码虽是软件的载体,但并非所有决策都应在代码中做出。
Qwen 团队发布 Qwen-Image-Layered 模型,可将一张图像分解为多个 RGBA 图层,实现原生可编辑性。每个图层可独立操作而不影响其他内容,并原生支持缩放、重定位和重新着色等高保真基础操作。
Sierra 发布 Workspaces,将 GitHub、Figma 式的协作模式引入 AI 智能体开发,支持团队成员在各自 Workspace 中并行构建、测试,再通过合并生成快照并发布到 QA、staging 或生产环境。
Ant Group DeepXPU 团队与 SGLang 团队在 SGLang 中实现扩散大语言模型(dLLM)框架,Day-0 支持 LLaDA 2.0。方案复用现有 Chunked-Prefill 机制,无需改动 SGLang 核心架构,支持自定义扩散解码算法、流式输出、张量并行和 CUDA graph 优化。
推荐理由:原文给出基于 Chunked-Prefill 实现 dLLM 支持的设计细节和实测吞吐数据,读者可据此评估 SGLang 上扩散模型的推理可行性。
Gemini API 在 v1beta 的 Interactions API 中引入一项破坏性变更,将 total_reasoning_tokens 字段更名为 total_thought_tokens,以更贴合思考型模型中"thoughts"的概念。该改动已于 12 月 19 日生效,使用该字段的开发者需相应调整代码。
Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上对 Mistral OCR 2 取得 74% 的整体胜率,输出支持带 HTML 表格重建的 markdown。
推荐理由:官方给出了对比 Mistral OCR 2 的胜率、价格和 API 入口,读者可以据此评估文档解析方案的替换成本。
LMSYS 推出源自 SGLang 的轻量级推理框架 Mini-SGLang,代码仅 5k 行 Python,保留 Radix Attention、Chunked Prefill、Overlap Scheduling、Tensor Parallelism 等核心优化,并提供 OpenAI 兼容 API 和开箱即用的 Llama-3、Qwen-3 支持。
推荐理由:官方介绍这款仅 5k 行代码的推理引擎保留了哪些关键优化,以及如何用它学习和做研究原型。
Google 在 Gemini API 更新日志中宣布推出 Gemini 3 Flash Preview(gemini-3-flash-preview),定位为以更低成本提供对标更大模型的快速前沿性能。新模型升级了视觉与空间推理以及智能体编码能力,并附带多模态函数响应、带图像的代码执行等新功能文档。
推荐理由:官方日志给出新模型的定位、成本与新增功能入口,便于评估其在现有 Gemini API 工作流中的替换价值。
Sierra 宣布在巴黎设立新团队,这是继伦敦、新加坡、东京之后的新办公地点。Sierra 表示将帮助法国航空航天、能源和奢侈品等行业的企业用 AI 打造更人性化的客户体验,并正在当地招聘。
Gemini 发布 gemini-2.5-flash-native-audio-preview-12-2025,这是面向 Live API 的新原生音频模型,提升了处理复杂工作流的能力。用户可查阅 Live API 指南和 Gemini 2.5 Flash Native Audio 了解详情。
Gemini API 发布 Interactions API,为 Gemini 模型和智能体提供统一交互接口。同时上线 Gemini Deep Research 智能体预览版,可自主规划、执行并综合多步骤研究任务的结果。
Microsoft AI 发布《Copilot 使用报告 2025》,基于 3750 万次对话的脱敏摘要数据分析了用户的真实使用模式。健康类话题在移动端全年居首,2 月情人节前后关系类对话明显激增,编程与游戏话题在 8 月出现交叉——工作日偏编程、周末偏游戏。报告还发现凌晨时段宗教与哲学类对话排名上升,且用户寻求个人建议的对话占比持续增长。
Sierra 发布 Visual Attachments,让聊天智能体在对话中直接嵌入进度条、安全输入框、庆祝卡片等可视化 UI 组件。这些组件用 React 构建,可在 Agent Studio 中无代码部署,并支持无障碍、响应式与效果度量。Rocket Mortgage 的预资格智能体采用后,客户转接银行专员时的转化率在再融资和购房流程中均提升 4 倍。
Gemini 2.5 Flash TTS 和 Gemini 2.5 Pro TTS 预览版迎来增强,前者针对低延迟优化,后者针对质量优化。此次更新提升了表现力、精确节奏控制和无缝对话能力。
Mistral 发布开源编码模型 Devstral 2(123B,修改版 MIT)和 Devstral Small 2(24B,Apache 2.0),SWE-bench Verified 分别达 72.2% 和 68.0%,均支持 256K 上下文。
推荐理由:官方给出了两个尺寸的开源编码模型参数量、SWE-bench Verified 成绩、API 定价和部署门槛,可与闭源竞品直接对比。
Qwen 发布 Qwen3-Omni,称其为新一代原生多模态大模型,可处理文本、图像、音频、视频输入,并通过实时流式响应同时生成文本和自然语音输出。
Gemini Live API 关停 gemini-2.0-flash-live-001 和 gemini-live-2.5-flash-preview 两款模型。此次调整来自 Gemini API 更新日志,涉及 Gemini 实时语音交互接口的模型可用性变更。
千问(Qwen)提出 SAPO,一种用于训练大语言模型的稳定且高性能的强化学习方法。该方法针对实践中基于组的策略优化——即每个提示词采样多个回答并在组内归一化奖励——进行改进。
千问 Qwen3-TTS-Flash 旗舰语音合成模型更新,支持 49 种以上高品质音色、10 种语言和 9 种方言,覆盖不同性别、年龄、地域特征与角色设定。该模型可通过 Qwen API 调用,主打自然且富有表现力的语音合成。
Gemini 3 的 Grounding with Google Search 功能将于 2026 年 1 月 5 日开始计费。该功能此前可免费使用,计费启动后相关调用将产生费用。
Toyota 北加州经销商协会与创意机构 H/L 基于 ElevenLabs Agents 平台,推出由 AI 语音版 49ers 四分卫 Brock Purdy 主持的语音问答互动体验,落地页为 toyotaletsgo.com/brock-purdy。
Mistral 发布新一代模型系列 Mistral 3,包括 14B/8B/3B 的 Ministral 3 小模型和 sparse MoE 架构的 Mistral Large 3(41B 激活、675B 总参数),全部以 Apache 2.0 许可开源,提供 base、instruct 和 reasoning 变体。
推荐理由:官方公布完整模型规格、开源许可和部署路径,读者可据此评估在自建或端侧场景的可用性。
DeepSeek 宣布 API 的 deepseek-chat 和 deepseek-reasoner 均已升级为 DeepSeek-V3.2。deepseek-chat 对应非思考模式,deepseek-reasoner 对应思考模式。
推荐理由:官方说明了两条 API 模型线与 DeepSeek-V3.2 思考模式的对应关系,方便使用 API 的开发者确认升级后的调用变化。
DeepSeek 非正式部署 DeepSeek-V3.2-Speciale API 服务,用户通过 base_url="https://api.deepseek.com/v3.2_speciale_expires_on_20251215" 访问。价格不变,仅支持思考模式下的对话功能,不支持工具调用,最大输出长度默认 128K,支持至北京时间 2025-12-15 23:59。
推荐理由:原文给出了非正式部署的访问方式和明确截止时间,用户可以据此判断是否短期试用这个思考模式模型。
Suno 宣布与 Warner Music Group(WMG)达成新合作,将用高质量授权音乐训练新一代模型,称其将超越目前最好的 v5。WMG 艺人可自愿授权姓名、形象、声音和作品用于 AI 生成音乐并获得新收入;未来下载歌曲需付费账号,各付费档位含每月下载额度,Suno Studio 保持不变并保留无限下载。
推荐理由:Suno 官方说明与 Warner Music Group 合作后的产品变化,包括付费下载门槛和授权模型计划,读者可据此调整使用方式。
ElevenLabs 与 Liberty Global Ventures 达成商业合作,后者将对其进行战略投资,双方聚焦语音 AI 在电信与娱乐产品中的落地,包括 AI 客服智能体和联网电视、流媒体语音交互界面。该投资由 Liberty Global Ventures 合伙人 Rebecca Hunt 主导,将支持 ElevenLabs 在全球扩展其基础语音模型。
Mistral AI 宣布通过多项长期战略承诺扩展在德国的业务。其中与 SAP 建立多年期合作,将 Mistral 模型集成到 SAP AI Foundation,为德国和欧洲提供完全主权 AI 堆栈并共同开发面向复杂行业和行政机构的行业解决方案;与 Helsing 加速开发面向国防和安全应用的视觉-语言-动作模型。Mistral 还计划大幅增加德国本地团队,并在未来几个月开设德国办公室。
Suno 宣布完成 2.5 亿美元 Series C 融资,投后估值 24.5 亿美元,由 Menlo Ventures 领投,NVentures(NVIDIA 风投部门)、Hallwood Media、Lightspeed 和 Matrix 参投。过去两年近 1 亿人在 Suno 上创作过音乐,公司称将用新资金为专业音乐人开发更复杂的工具、改善休闲创作者体验,并建设音乐社交与分享生态。
推荐理由:官方公告给出融资金额、估值和投资方名单,并说明资金将投向专业工具与社交功能的扩展方向。
ElevenLabs 发布 Image & Video(Beta),在单一平台内整合图像与视频生成能力。可使用 Veo、Sora、Kling、Wan、Seedance 等模型生成视频,用 Nanobanana、Flux Kontext、GPT Image、Seedream 生成图像,并支持放大和用 ElevenLabs 语音添加 lipsync。
推荐理由:官方发布介绍了平台内聚合多家视频与图像模型并接续语音制作的完整流程,读者可以据此评估能否把现有分散的创作环节合并到一处。
Qwen 团队发布 Qwen DeepResearch,并提供了在线体验入口。原文以灵感常因成本考量而搁置为引子展开,正文在来源中仅有开头片段,更多细节未完整呈现。
ElevenLabs 与 AI 法律平台 Harvey 达成合作,基于 ElevenLabs 的 Text to Speech 和 Speech to Text 技术,为法律行业打造首个全球多语言语音能力,让 Harvey 能以数十种语言、方言和口音自然交流。第一阶段 Harvey 将支持以几乎任意语言或方言语音输出答案,后续将推出多语言语音翻译、语音模式、模拟庭审语音、语气定制等功能。
ElevenLabs 在首届 Summit 上宣布,奥斯卡影帝 Matthew McConaughey 已作为投资人、早期支持者参与公司多年,如今还成为创作者。他的 newsletter《Lyrics of Livin'》将借助 ElevenLabs 推出西班牙语版本,用他本人的声音生成西班牙语音频内容,触达更广受众。
ElevenLabs 发布实时语音转文字模型 Scribe v2 Realtime,延迟低于 150 ms,支持英语、法语、德语、意大利语、西班牙语、葡萄牙语及共 90 种语言,在 30 种欧洲和亚洲语言上达到 93.5% 准确率。模型面向语音智能体等实时场景,提供负延迟预测、自动语言检测、VAD、多音频格式支持,已通过 API 和 ElevenLabs Agents 开放使用。
ElevenLabs 推出 Iconic Marketplace,一个面向企业授权名人声音的双边平台,Sir Michael Caine 已入驻,平台目前上线超过 25 位标志性声音,包括 Dr. Maya Angelou、Alan Turing、Liza Minelli 和 Art Garfunkel。
Linear 客户体验团队将 Intercom、Slack、X、Reddit 等渠道的客户反馈通过 Linear-Intercom 集成和 Linear Asks 模板转为 Linear issue,分别进入工程与产品 triage 队列。
Microsoft AI 发布长文,提出 Humanist Superintelligence(HSI)理念,即面向具体领域、受控服务于人类的超智能,并宣布组建由作者领导的 MAI Superintelligence Team。
推荐理由:Microsoft AI 提出以人类为中心、领域受限的超智能路线,文中给出医疗诊断等具体方向和 containment 难题的判断。
ElevenLabs 访问基辅,与乌克兰数字转型部长 Mykhailo Fedorov 签署谅解备忘录,将 AI 公共服务从概念推向生产。
伯克利 AI 研究提出一种基于分治(divide and conquer)范式的 off-policy 强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到任意长时程任务。
Linear 推出持续规划(continuous planning)流程,让产品团队在想法到来时即整理为候选项目,而非每季度面对空白页重新规划。2025 年起该流程引入 AI 维护项目,智能分诊建议可识别新需求是否与现有 issue 重复或归属同一项目。