LMSYS 联合蚂蚁、美团等发布 SpecBundle(Phase 1)与 SpecForge v0.2
SpecForge 团队联合蚂蚁集团、美团、Nex-AGI 和 EigenAI 发布 SpecBundle(Phase 1),提供覆盖 8B 到 1T 参数主流 instruct 模型的生产级 EAGLE3 草稿模型权重,最高可达 4 倍端到端推理加速。
媒体报道、公司博客与研究文章
SpecForge 团队联合蚂蚁集团、美团、Nex-AGI 和 EigenAI 发布 SpecBundle(Phase 1),提供覆盖 8B 到 1T 参数主流 instruct 模型的生产级 EAGLE3 草稿模型权重,最高可达 4 倍端到端推理加速。
Linear 发文讨论“用代码做设计”之争,认为把设计等同于代码是过度简化,真正的问题是 AI 与新工具下设计师和工程师的角色如何演变,是否会出现“head of craft”这类新职位。文章主张先厘清问题本身再谈方案,并指出代码虽是软件的载体,但并非所有决策都应在代码中做出。
Qwen 团队发布 Qwen-Image-Layered 模型,可将一张图像分解为多个 RGBA 图层,实现原生可编辑性。每个图层可独立操作而不影响其他内容,并原生支持缩放、重定位和重新着色等高保真基础操作。
Sierra 发布 Workspaces,将 GitHub、Figma 式的协作模式引入 AI 智能体开发,支持团队成员在各自 Workspace 中并行构建、测试,再通过合并生成快照并发布到 QA、staging 或生产环境。
Ant Group DeepXPU 团队与 SGLang 团队在 SGLang 中实现扩散大语言模型(dLLM)框架,Day-0 支持 LLaDA 2.0。方案复用现有 Chunked-Prefill 机制,无需改动 SGLang 核心架构,支持自定义扩散解码算法、流式输出、张量并行和 CUDA graph 优化。
推荐理由:原文给出基于 Chunked-Prefill 实现 dLLM 支持的设计细节和实测吞吐数据,读者可据此评估 SGLang 上扩散模型的推理可行性。
Gemini API 在 v1beta 的 Interactions API 中引入一项破坏性变更,将 total_reasoning_tokens 字段更名为 total_thought_tokens,以更贴合思考型模型中"thoughts"的概念。该改动已于 12 月 19 日生效,使用该字段的开发者需相应调整代码。
Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上对 Mistral OCR 2 取得 74% 的整体胜率,输出支持带 HTML 表格重建的 markdown。
推荐理由:官方给出了对比 Mistral OCR 2 的胜率、价格和 API 入口,读者可以据此评估文档解析方案的替换成本。
Replit 发布免费教育平台 Replit Learn,教用户无需编程经验用 AI 构建应用。首个课程 AI Foundations 当天开放前三课,另三课即将推出;核心方法是以 describe-critique-iterate 循环配合 Replit Agent 进行 vibe coding,前几课无需注册。
LMSYS 推出源自 SGLang 的轻量级推理框架 Mini-SGLang,代码仅 5k 行 Python,保留 Radix Attention、Chunked Prefill、Overlap Scheduling、Tensor Parallelism 等核心优化,并提供 OpenAI 兼容 API 和开箱即用的 Llama-3、Qwen-3 支持。
推荐理由:官方介绍这款仅 5k 行代码的推理引擎保留了哪些关键优化,以及如何用它学习和做研究原型。
Google 在 Gemini API 更新日志中宣布推出 Gemini 3 Flash Preview(gemini-3-flash-preview),定位为以更低成本提供对标更大模型的快速前沿性能。新模型升级了视觉与空间推理以及智能体编码能力,并附带多模态函数响应、带图像的代码执行等新功能文档。
推荐理由:官方日志给出新模型的定位、成本与新增功能入口,便于评估其在现有 Gemini API 工作流中的替换价值。
PromptArmor 披露,攻击者可在网页、文档或 MCP 工具响应中植入恶意指令,诱导 HuggingChat 中的模型输出动态生成的 Markdown 图片,在聊天中渲染时外泄 AI 可访问的其他来源数据。演示显示网页注入可窃取用户上传文档中的机密财务数据。该漏洞已于 2025/12/1 负责任披露给 HuggingFace,因安全团队未回应而公开。
推荐理由:原文完整演示了通过网页注入诱导 HuggingChat 输出恶意 Markdown 图片外泄用户文档数据的路径,并说明了披露时间线。
Factory 发布上下文压缩评测框架,用四类探针和 GPT-5.2 评审,在 36,611 条生产消息上对比自家、OpenAI 和 Anthropic 三种压缩方案。Factory 结构化摘要总体得分 3.70,高于 Anthropic 3.44 和 OpenAI 3.35;OpenAI 压缩率最高达 99.3%,但文件追踪是所有方法的共同弱项,得分仅 2.19 到 2.45。
Replit 详细解读了让 Agent 3 自主自测的 REPL 式验证系统,用代码执行结合 Playwright 浏览器自动化来捕捉看似可用实则未接线的 Potemkin 界面。该方案把测试拆到独立子代理以避免上下文污染,配合简化 DOM、数据库只读查询和日志信息,使 Agent 3 的自主工作时长从 20 分钟提升到 200 分钟以上,每次测试会话中位成本约 $0.20。
Sierra 宣布在巴黎设立新团队,这是继伦敦、新加坡、东京之后的新办公地点。Sierra 表示将帮助法国航空航天、能源和奢侈品等行业的企业用 AI 打造更人性化的客户体验,并正在当地招聘。
Gemini 发布 gemini-2.5-flash-native-audio-preview-12-2025,这是面向 Live API 的新原生音频模型,提升了处理复杂工作流的能力。用户可查阅 Live API 指南和 Gemini 2.5 Flash Native Audio 了解详情。
Gemini API 发布 Interactions API,为 Gemini 模型和智能体提供统一交互接口。同时上线 Gemini Deep Research 智能体预览版,可自主规划、执行并综合多步骤研究任务的结果。
Microsoft AI 发布《Copilot 使用报告 2025》,基于 3750 万次对话的脱敏摘要数据分析了用户的真实使用模式。健康类话题在移动端全年居首,2 月情人节前后关系类对话明显激增,编程与游戏话题在 8 月出现交叉——工作日偏编程、周末偏游戏。报告还发现凌晨时段宗教与哲学类对话排名上升,且用户寻求个人建议的对话占比持续增长。
Replit 为每个部署引入独立的生产数据库,并在部署时对比开发与生产库的 schema 差异,自动生成迁移语句。该方案基于 Drizzle 的 drizzle-kit CLI 做确定性迁移生成,并借助 Neon 的数据库分支功能创建生产库临时副本,让用户在推送到生产前测试迁移、解决冲突。
Sierra 发布 Visual Attachments,让聊天智能体在对话中直接嵌入进度条、安全输入框、庆祝卡片等可视化 UI 组件。这些组件用 React 构建,可在 Agent Studio 中无代码部署,并支持无障碍、响应式与效果度量。Rocket Mortgage 的预资格智能体采用后,客户转接银行专员时的转化率在再融资和购房流程中均提升 4 倍。
Gemini 2.5 Flash TTS 和 Gemini 2.5 Pro TTS 预览版迎来增强,前者针对低延迟优化,后者针对质量优化。此次更新提升了表现力、精确节奏控制和无缝对话能力。
Mistral 发布开源编码模型 Devstral 2(123B,修改版 MIT)和 Devstral Small 2(24B,Apache 2.0),SWE-bench Verified 分别达 72.2% 和 68.0%,均支持 256K 上下文。
推荐理由:官方给出了两个尺寸的开源编码模型参数量、SWE-bench Verified 成绩、API 定价和部署门槛,可与闭源竞品直接对比。
Qwen 发布 Qwen3-Omni,称其为新一代原生多模态大模型,可处理文本、图像、音频、视频输入,并通过实时流式响应同时生成文本和自然语音输出。
Gemini Live API 关停 gemini-2.0-flash-live-001 和 gemini-live-2.5-flash-preview 两款模型。此次调整来自 Gemini API 更新日志,涉及 Gemini 实时语音交互接口的模型可用性变更。
千问(Qwen)提出 SAPO,一种用于训练大语言模型的稳定且高性能的强化学习方法。该方法针对实践中基于组的策略优化——即每个提示词采样多个回答并在组内归一化奖励——进行改进。
千问 Qwen3-TTS-Flash 旗舰语音合成模型更新,支持 49 种以上高品质音色、10 种语言和 9 种方言,覆盖不同性别、年龄、地域特征与角色设定。该模型可通过 Qwen API 调用,主打自然且富有表现力的语音合成。
Gemini 3 的 Grounding with Google Search 功能将于 2026 年 1 月 5 日开始计费。该功能此前可免费使用,计费启动后相关调用将产生费用。
Toyota 北加州经销商协会与创意机构 H/L 基于 ElevenLabs Agents 平台,推出由 AI 语音版 49ers 四分卫 Brock Purdy 主持的语音问答互动体验,落地页为 toyotaletsgo.com/brock-purdy。
PromptArmor 披露法律 AI 工具 vLex Vincent AI 的提示词注入漏洞:上传文档中以白底白字隐藏的伪证词可诱导 Vincent AI 输出 HTML 代码,在用户浏览器中渲染仿冒 vLex 登录页的钓鱼弹窗窃取凭据。
推荐理由:原文完整拆解了提示词注入到屏幕劫持钓鱼的三步攻击链,并给出已被厂商采纳的防护配置建议。
Mistral 发布新一代模型系列 Mistral 3,包括 14B/8B/3B 的 Ministral 3 小模型和 sparse MoE 架构的 Mistral Large 3(41B 激活、675B 总参数),全部以 Apache 2.0 许可开源,提供 base、instruct 和 reasoning 变体。
推荐理由:官方公布完整模型规格、开源许可和部署路径,读者可据此评估在自建或端侧场景的可用性。
DeepSeek 宣布 API 的 deepseek-chat 和 deepseek-reasoner 均已升级为 DeepSeek-V3.2。deepseek-chat 对应非思考模式,deepseek-reasoner 对应思考模式。
推荐理由:官方说明了两条 API 模型线与 DeepSeek-V3.2 思考模式的对应关系,方便使用 API 的开发者确认升级后的调用变化。
DeepSeek 非正式部署 DeepSeek-V3.2-Speciale API 服务,用户通过 base_url="https://api.deepseek.com/v3.2_speciale_expires_on_20251215" 访问。价格不变,仅支持思考模式下的对话功能,不支持工具调用,最大输出长度默认 128K,支持至北京时间 2025-12-15 23:59。
推荐理由:原文给出了非正式部署的访问方式和明确截止时间,用户可以据此判断是否短期试用这个思考模式模型。
Suno 宣布与 Warner Music Group(WMG)达成新合作,将用高质量授权音乐训练新一代模型,称其将超越目前最好的 v5。WMG 艺人可自愿授权姓名、形象、声音和作品用于 AI 生成音乐并获得新收入;未来下载歌曲需付费账号,各付费档位含每月下载额度,Suno Studio 保持不变并保留无限下载。
推荐理由:Suno 官方说明与 Warner Music Group 合作后的产品变化,包括付费下载门槛和授权模型计划,读者可据此调整使用方式。
ElevenLabs 与 Liberty Global Ventures 达成商业合作,后者将对其进行战略投资,双方聚焦语音 AI 在电信与娱乐产品中的落地,包括 AI 客服智能体和联网电视、流媒体语音交互界面。该投资由 Liberty Global Ventures 合伙人 Rebecca Hunt 主导,将支持 ElevenLabs 在全球扩展其基础语音模型。
PromptArmor 发布对 Google Antigravity 的安全分析,演示通过藏在网页指南中的间接提示词注入操纵 Gemini 调用浏览器子代理,将用户 IDE 中的凭证和代码外泄到攻击者控制的 webhook.site 地址。
推荐理由:原文完整拆解了从间接提示词注入到浏览器子代理外泄凭证的攻击链,并指出默认白名单和设置可被绕过,具备可验证的技术细节。
Factory 披露其在 10 月检测并瓦解一起针对 Droid 平台的 AI 编排网络欺诈行动。攻击者利用 AI 编码智能体生成代理服务器、自动注册脚本和混淆逻辑,批量薅取免费 token 并转售,涉及数万个合成组织,Factory 评估有高置信度来自中国境内的大型组织且可能涉及国家级行为体。
推荐理由:Factory 以当事方身份复盘 AI 智能体驱动的欺诈攻击与 AI 防御过程,给出攻击手法细节和可借鉴的防御思路。
Mistral AI 宣布通过多项长期战略承诺扩展在德国的业务。其中与 SAP 建立多年期合作,将 Mistral 模型集成到 SAP AI Foundation,为德国和欧洲提供完全主权 AI 堆栈并共同开发面向复杂行业和行政机构的行业解决方案;与 Helsing 加速开发面向国防和安全应用的视觉-语言-动作模型。Mistral 还计划大幅增加德国本地团队,并在未来几个月开设德国办公室。
Suno 宣布完成 2.5 亿美元 Series C 融资,投后估值 24.5 亿美元,由 Menlo Ventures 领投,NVentures(NVIDIA 风投部门)、Hallwood Media、Lightspeed 和 Matrix 参投。过去两年近 1 亿人在 Suno 上创作过音乐,公司称将用新资金为专业音乐人开发更复杂的工具、改善休闲创作者体验,并建设音乐社交与分享生态。
推荐理由:官方公告给出融资金额、估值和投资方名单,并说明资金将投向专业工具与社交功能的扩展方向。
Factory 宣布与 Palo Alto Networks 的 Prisma AIRS 原生集成,将实时安全防护直接嵌入开发者工作流。该集成可检查提示词、模型响应及后续工具调用,实时标记或阻断提示注入攻击和异常工具调用,保障代码与数据在智能体、模型和开发栈之间端到端安全。
ElevenLabs 发布 Image & Video(Beta),在单一平台内整合图像与视频生成能力。可使用 Veo、Sora、Kling、Wan、Seedance 等模型生成视频,用 Nanobanana、Flux Kontext、GPT Image、Seedream 生成图像,并支持放大和用 ElevenLabs 语音添加 lipsync。
推荐理由:官方发布介绍了平台内聚合多家视频与图像模型并接续语音制作的完整流程,读者可以据此评估能否把现有分散的创作环节合并到一处。
Qwen 团队发布 Qwen DeepResearch,并提供了在线体验入口。原文以灵感常因成本考量而搁置为引子展开,正文在来源中仅有开头片段,更多细节未完整呈现。