SGLang-Diffusion 两个月迭代:推理速度最高提升 2.5 倍并集成 ComfyUI
SGLang-Diffusion 团队发布发布两个月进展总结,当前版本(docker 镜像 lmsysorg/sglang:dev-pr-17247)比 2025 年 11 月初始版最快提升 2.5 倍,在 NVIDIA GPU 上比其他方案最高快 5 倍。
推荐理由:官方复盘两个月迭代成果,涵盖新模型支持、LoRA 与 ComfyUI 集成等具体改进,读者可评估是否迁移现有扩散推理工作流。
SGLang-Diffusion 团队发布发布两个月进展总结,当前版本(docker 镜像 lmsysorg/sglang:dev-pr-17247)比 2025 年 11 月初始版最快提升 2.5 倍,在 NVIDIA GPU 上比其他方案最高快 5 倍。
推荐理由:官方复盘两个月迭代成果,涵盖新模型支持、LoRA 与 ComfyUI 集成等具体改进,读者可评估是否迁移现有扩散推理工作流。
SGLang 推出高度优化的流水线并行(PP)实现,融合分块流水线并行、异步 P2P 通信与动态分块机制,专为超长上下文推理设计。在 H20 集群上以 PP4 TP8 部署 DeepSeek-V3.1、分块预填充设为 12K 时,预填充吞吐达 TP8 的 3.31 倍,比 TP32 方案高出 30.5%,同时 TTFT 最多降低 67.9%,强扩展效率保持 82.8%。
Sierra 与 Stellarus 达成合作,帮助健康计划大规模部署 AI 智能体。双方与 Blue Shield of California 合作推出的 AI 语音智能体上线六个月,可 24/7 回答福利与覆盖范围等会员咨询,在数千次交互中取得 4.4(满分 5)的客户满意度评分。双方下一步将从被动支持转向主动的 AI 驱动互动。
SGLang 推出 Encoder-Prefill-Decode(EPD)分离架构,将视觉编码从语言处理中拆出,编码器服务器可独立横向扩展,并兼容现有 PD 分离形成三层架构。
伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,在彩色摄影、射电天文、无透镜成像和显微成像四个领域预测下游解码性能。该方法在 NeurIPS 2025 论文中展示,优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器。
SpecForge 团队联合蚂蚁集团、美团、Nex-AGI 和 EigenAI 发布 SpecBundle(Phase 1),提供覆盖 8B 到 1T 参数主流 instruct 模型的生产级 EAGLE3 草稿模型权重,最高可达 4 倍端到端推理加速。
Sierra 发布 Workspaces,将 GitHub、Figma 式的协作模式引入 AI 智能体开发,支持团队成员在各自 Workspace 中并行构建、测试,再通过合并生成快照并发布到 QA、staging 或生产环境。
Ant Group DeepXPU 团队与 SGLang 团队在 SGLang 中实现扩散大语言模型(dLLM)框架,Day-0 支持 LLaDA 2.0。方案复用现有 Chunked-Prefill 机制,无需改动 SGLang 核心架构,支持自定义扩散解码算法、流式输出、张量并行和 CUDA graph 优化。
推荐理由:原文给出基于 Chunked-Prefill 实现 dLLM 支持的设计细节和实测吞吐数据,读者可据此评估 SGLang 上扩散模型的推理可行性。
Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上对 Mistral OCR 2 取得 74% 的整体胜率,输出支持带 HTML 表格重建的 markdown。
推荐理由:官方给出了对比 Mistral OCR 2 的胜率、价格和 API 入口,读者可以据此评估文档解析方案的替换成本。
LMSYS 推出源自 SGLang 的轻量级推理框架 Mini-SGLang,代码仅 5k 行 Python,保留 Radix Attention、Chunked Prefill、Overlap Scheduling、Tensor Parallelism 等核心优化,并提供 OpenAI 兼容 API 和开箱即用的 Llama-3、Qwen-3 支持。
推荐理由:官方介绍这款仅 5k 行代码的推理引擎保留了哪些关键优化,以及如何用它学习和做研究原型。
Sierra 宣布在巴黎设立新团队,这是继伦敦、新加坡、东京之后的新办公地点。Sierra 表示将帮助法国航空航天、能源和奢侈品等行业的企业用 AI 打造更人性化的客户体验,并正在当地招聘。
Microsoft AI 发布《Copilot 使用报告 2025》,基于 3750 万次对话的脱敏摘要数据分析了用户的真实使用模式。健康类话题在移动端全年居首,2 月情人节前后关系类对话明显激增,编程与游戏话题在 8 月出现交叉——工作日偏编程、周末偏游戏。报告还发现凌晨时段宗教与哲学类对话排名上升,且用户寻求个人建议的对话占比持续增长。
Sierra 发布 Visual Attachments,让聊天智能体在对话中直接嵌入进度条、安全输入框、庆祝卡片等可视化 UI 组件。这些组件用 React 构建,可在 Agent Studio 中无代码部署,并支持无障碍、响应式与效果度量。Rocket Mortgage 的预资格智能体采用后,客户转接银行专员时的转化率在再融资和购房流程中均提升 4 倍。
Mistral 发布开源编码模型 Devstral 2(123B,修改版 MIT)和 Devstral Small 2(24B,Apache 2.0),SWE-bench Verified 分别达 72.2% 和 68.0%,均支持 256K 上下文。
推荐理由:官方给出了两个尺寸的开源编码模型参数量、SWE-bench Verified 成绩、API 定价和部署门槛,可与闭源竞品直接对比。
Mistral 发布新一代模型系列 Mistral 3,包括 14B/8B/3B 的 Ministral 3 小模型和 sparse MoE 架构的 Mistral Large 3(41B 激活、675B 总参数),全部以 Apache 2.0 许可开源,提供 base、instruct 和 reasoning 变体。
推荐理由:官方公布完整模型规格、开源许可和部署路径,读者可据此评估在自建或端侧场景的可用性。
DeepSeek 宣布 API 的 deepseek-chat 和 deepseek-reasoner 均已升级为 DeepSeek-V3.2。deepseek-chat 对应非思考模式,deepseek-reasoner 对应思考模式。
推荐理由:官方说明了两条 API 模型线与 DeepSeek-V3.2 思考模式的对应关系,方便使用 API 的开发者确认升级后的调用变化。
DeepSeek 非正式部署 DeepSeek-V3.2-Speciale API 服务,用户通过 base_url="https://api.deepseek.com/v3.2_speciale_expires_on_20251215" 访问。价格不变,仅支持思考模式下的对话功能,不支持工具调用,最大输出长度默认 128K,支持至北京时间 2025-12-15 23:59。
推荐理由:原文给出了非正式部署的访问方式和明确截止时间,用户可以据此判断是否短期试用这个思考模式模型。
Suno 宣布与 Warner Music Group(WMG)达成新合作,将用高质量授权音乐训练新一代模型,称其将超越目前最好的 v5。WMG 艺人可自愿授权姓名、形象、声音和作品用于 AI 生成音乐并获得新收入;未来下载歌曲需付费账号,各付费档位含每月下载额度,Suno Studio 保持不变并保留无限下载。
推荐理由:Suno 官方说明与 Warner Music Group 合作后的产品变化,包括付费下载门槛和授权模型计划,读者可据此调整使用方式。
Mistral AI 宣布通过多项长期战略承诺扩展在德国的业务。其中与 SAP 建立多年期合作,将 Mistral 模型集成到 SAP AI Foundation,为德国和欧洲提供完全主权 AI 堆栈并共同开发面向复杂行业和行政机构的行业解决方案;与 Helsing 加速开发面向国防和安全应用的视觉-语言-动作模型。Mistral 还计划大幅增加德国本地团队,并在未来几个月开设德国办公室。
Suno 宣布完成 2.5 亿美元 Series C 融资,投后估值 24.5 亿美元,由 Menlo Ventures 领投,NVentures(NVIDIA 风投部门)、Hallwood Media、Lightspeed 和 Matrix 参投。过去两年近 1 亿人在 Suno 上创作过音乐,公司称将用新资金为专业音乐人开发更复杂的工具、改善休闲创作者体验,并建设音乐社交与分享生态。
推荐理由:官方公告给出融资金额、估值和投资方名单,并说明资金将投向专业工具与社交功能的扩展方向。
Linear 客户体验团队将 Intercom、Slack、X、Reddit 等渠道的客户反馈通过 Linear-Intercom 集成和 Linear Asks 模板转为 Linear issue,分别进入工程与产品 triage 队列。
Microsoft AI 发布长文,提出 Humanist Superintelligence(HSI)理念,即面向具体领域、受控服务于人类的超智能,并宣布组建由作者领导的 MAI Superintelligence Team。
推荐理由:Microsoft AI 提出以人类为中心、领域受限的超智能路线,文中给出医疗诊断等具体方向和 containment 难题的判断。
Linear 推出持续规划(continuous planning)流程,让产品团队在想法到来时即整理为候选项目,而非每季度面对空白页重新规划。2025 年起该流程引入 AI 维护项目,智能分诊建议可识别新需求是否与现有 issue 重复或归属同一项目。
Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,包含 Observability、Agent Runtime 和 AI Registry 三大支柱。
Linear 发布官方文章提出“自动驾驶 SaaS”愿景,认为真正变革在于 AI 主动推进工作,而非在旧系统上加聊天机器人。文章类比自动驾驶分级描述三种自主级别,从建议分配 issue 到规则自动执行,再到 coding agent 全程处理特定类别 issue,并称这已是 Linear 的产品方向。
Microsoft AI 于 2025 年 10 月 13 日宣布 MAI-Image 1,这是其首个完全在内部开发的图像生成模型,首日进入 LMArena 文生图模型前十。
推荐理由:微软首次完全自研的图像生成模型,官方说明了训练重点、擅长场景和后续落地产品,可了解其定位与可用入口。
deepseek-chat 和 deepseek-reasoner 均已升级为 DeepSeek-V3.2-Exp。deepseek-chat 对应该模型非思考模式,deepseek-reasoner 对应思考模式,详细更新内容需参阅官方文档。
推荐理由:官方说明两个 API 端点均已切换至新实验版模型,读后可据此确认调用行为是否受影响。
Suno 宣布推出 Suno Studio,定位为生成式音频工作站,将 AI 生成融入音乐创作流程。它支持即时生成人声、鼓、合成器等无限 stem 变体,提供多轨时间线编辑、BPM、音量和音高控制,并可将 stem 导出为音频和 MIDI 文件回到任意 DAW。Suno Studio 已在桌面端面向 Premier 用户开放。
DeepSeek 官方宣布 deepseek-chat 和 deepseek-reasoner 均已升级为 DeepSeek-V3.1-Terminus,分别对应其非思考模式和思考模式。此次更新保持模型原有能力,针对用户反馈改进了语言一致性,缓解中英文混杂和偶发异常字符问题,并优化了 Code Agent 与 Search Agent 的表现。
推荐理由:官方说明升级后的接口对应关系和两类具体改进,现有用户可据此判断是否切换或观察效果。
Mistral AI 宣布完成 1.7B€ C 轮融资,投后估值 11.7B€,由 ASML 领投,DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 和 NVIDIA 参投。
推荐理由:官方原文给出融资金额、估值和 ASML 领投的战略合作细节,可了解这笔资金将投向工业级定制 AI 方案。
Linear 复盘上月推出的 Triage Intelligence 的构建过程,该功能用搜索、排序和 LLM 推理为新 issue 标记重复、关联相关 issue,并推荐标签或负责人等属性。
Mistral AI 在 Le Chat 中推出 Memories(beta)记忆功能,采用自动保存与智能、可见召回结合的混合方案。功能强调三大原则:透明(显示记忆来源与相关性)、可控(可关闭、开启无痕聊天、编辑或删除单条记忆)、可移植(支持导出和导入)。
Mistral AI 为 Le Chat 发布 20+ 个 MCP 驱动的安全连接器(beta)和 Memories(beta)记忆功能。
Microsoft AI(MAI)发布两款自研模型:语音生成模型 MAI-Voice-1 已用于 Copilot Daily 和 Podcasts,并上线 Copilot Labs 体验。
推荐理由:Microsoft AI 官方公布两款自研模型的训练规模、使用入口与后续路线,读者可了解其自研模型布局。
Linear 宣布新的 Cursor 集成,用户可以像指派给队友一样把 issue 直接分配给 Cursor agents。Cursor agents 可承接编码任务、开启 pull request 并把进度同步回 Linear。
DeepSeek 宣布 deepseek-chat 和 deepseek-reasoner 均升级为 DeepSeek-V3.1,分别对应其非思考模式与思考模式。
推荐理由:官方说明了两个 API 端点对应的模式切换,并给出 SWE-bench 等三项基准分数,读者可据此评估升级影响。
Linear 介绍其 Agent Interaction SDK 的构建思路:通过 OAuth 的 actor=app 模式让 Agent 成为工作区内的一等用户,新增 app:assignable 和 app:mentionable 两个可选权限控制 Agent 能否被指派或提及。
Mistral 用 LoRA 微调 Pixtral-12B 处理卫星图像,在 Aerial Image Dataset(AID)上显著优于基座模型。基座模型在 Playground 与 Stadium 等模糊类别上易混淆,甚至幻觉出不存在的类别名,微调后分类更准确。微调通过 Mistral 微调 API 或 LaPlateforme UI 完成,无需大量超参数调优。
Mistral AI 发布 Codestral 25.08,并整合 Codestral Embed、Devstral 和 Mistral Code IDE 插件形成企业级完整编码栈,覆盖云、VPC 和本地部署。
Mistral AI 联合 Carbone 4 和法国生态转型署 ADEME 完成首个针对大模型的全生命周期环境评估。