Qwen 开源 Qwen3-ASR 系列语音识别模型与 Qwen3-ForcedAligner 对齐模型
Qwen 团队宣布开源 Qwen3-ASR 系列与 Qwen3-ForcedAligner。系列包含 Qwen3-ASR-1.7B 和 Qwen3-ASR-0.6B 两款一体化语音识别模型,支持语言识别,并带来一款新型非自回归语音强制对齐模型,主打鲁棒性、流式处理和多语言。
媒体报道、公司博客与研究文章
Qwen 团队宣布开源 Qwen3-ASR 系列与 Qwen3-ForcedAligner。系列包含 Qwen3-ASR-1.7B 和 Qwen3-ASR-0.6B 两款一体化语音识别模型,支持语言识别,并带来一款新型非自回归语音强制对齐模型,主打鲁棒性、流式处理和多语言。
Gemini API 宣布在 gemini-3-pro-preview 和 gemini-3-flash-preview 上推出 Computer Use 工具支持,发布于 2026 年 1 月 29 日更新日志。
Revolut 部署 ElevenLabs Agents 作为英国和欧洲客户的语音客服第一线,覆盖超 400 万客户,支持 30 多种语言并实时切换。智能体解决工单不到 5 分钟,此前人工处理平均耗时 8 倍以上,超 99.7% 的通话顺利完成。Revolut 保留编排和业务逻辑控制权,方案满足 PCI 合规与零留存要求,并计划向全球扩展。
Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选澄清、斜杠命令技能和统一智能体模式。
推荐理由:官方公告给出 2.0 的功能清单、订阅方案和 Devstral 2 API 定价,读者可以据此评估是否把它纳入自己的终端开发工作流。
MiniMax 发布面向生产环境的角色扮演模型 MiniMax-M2-her。基于 Talkie/Xingye 三年运营观察,团队将 Role-Play 拆解为 Worlds。
千问发布最新旗舰推理模型 Qwen3-Max-Thinking,通过扩大模型参数并投入大量算力进行强化学习,在事实知识、复杂推理、指令遵循、人类偏好对齐和智能体能力等多个维度实现显著性能提升。
SGLang RL 团队联合 InfiXAI、蚂蚁集团等团队,在 slime 框架上落地了 INT4 QAT 端到端方案,训练用 fake quantization、推理用 W4A16,实现与 BF16 全精度相当的训练-推理一致性。
Sierra 发布 Expert Answers,可将 AI 智能体转交人工解决的客服对话自动生成可审核的知识文章,并回灌给智能体。该功能会识别智能体的知识缺口、学习相似问题的解决模式并生成草稿,供客服团队审核而非从零撰写。一家数字健康公司用其生成的文章测试部分流量,解决率提升 4% 且未增加客服工作量,随后全面铺开。
Qwen 团队宣布开源 Qwen3-TTS 系列语音生成模型。该系列支持语音克隆、语音设计和超高质量拟人生成等能力。
推荐理由:原文给出 Qwen3-TTS 开源与语音克隆、语音设计等能力范围,读者可据此评估它在语音生成场景的可用性。
Mistral AI 团队在预生产测试中发现,使用 vLLM 部署 Mistral Medium 3.1 并开启 graph compilation 的 Prefill/Decode 分离式推理下,系统内存以每分钟 400 MB 的速度线性增长,最终导致 out of memory。
ElevenLabs 推出 The Eleven Album,整张专辑由 Eleven Music 生成,合作艺人包括 Liza Minnelli、Art Garfunkel、KondZilla 等。
Gemini API 于 1 月 21 日调整最新别名,gemini-pro-latest 已切换至 gemini-3-pro-preview,gemini-flash-latest 已切换至 gemini-3-flash-preview。开发者通过这两个别名调用时将自动指向 Gemini 3 系列的预览版本。
Novita AI 基于 SGLang 为 GLM4-MoE 推出一套生产级推理优化方案,通过 Shared Experts Fusion 与 Suffix Decoding 等技术,在 H200 集群 TP8、FP8 配置下将 TTFT 最多降低 65%,智能体编程负载下 TPOT 改善 22%。
SGLang-Diffusion 团队发布发布两个月进展总结,当前版本(docker 镜像 lmsysorg/sglang:dev-pr-17247)比 2025 年 11 月初始版最快提升 2.5 倍,在 NVIDIA GPU 上比其他方案最高快 5 倍。
推荐理由:官方复盘两个月迭代成果,涵盖新模型支持、LoRA 与 ComfyUI 集成等具体改进,读者可评估是否迁移现有扩散推理工作流。
MasterClass 与 ElevenLabs 合作,为其 On Call 产品的 AI 导师提供 Text to Speech 语音能力,Gordon Ramsay、Mark Cuban、Chris Voss 等导师的 AI 版本可与用户实时语音对话。
SGLang 推出高度优化的流水线并行(PP)实现,融合分块流水线并行、异步 P2P 通信与动态分块机制,专为超长上下文推理设计。在 H20 集群上以 PP4 TP8 部署 DeepSeek-V3.1、分块预填充设为 12K 时,预填充吞吐达 TP8 的 3.31 倍,比 TP32 方案高出 30.5%,同时 TTFT 最多降低 67.9%,强扩展效率保持 82.8%。
Gemini API 宣布将于 2026 年 2 月 17 日关停 gemini-2.5-flash-preview-09-25、imagen-4.0-generate-preview-06-06 和 imagen-4.0-ultra-generate-preview-06-06 三个模型。此外,gemini-2.5-flash-image-preview 模型已被关停。
ElevenLabs 与 Deutsche Telekom 宣布合作,将 ElevenLabs 的 AI 语音智能体接入这家欧洲最大电信运营商的客服体系,通过 App 和电话提供服务。Deutsche Telekom 用户将可体验 24/7 在线、无需等待的拟人化语音客服。双方称此举旨在推动 AI 语音技术的普及。
Gemini API 更新日志显示,text-embedding-004 模型已被关停。该模型此前用于文本嵌入向量生成,关停后相关调用将不再可用。
Sierra 与 Stellarus 达成合作,帮助健康计划大规模部署 AI 智能体。双方与 Blue Shield of California 合作推出的 AI 语音智能体上线六个月,可 24/7 回答福利与覆盖范围等会员咨询,在数千次交互中取得 4.4(满分 5)的客户满意度评分。双方下一步将从被动支持转向主动的 AI 驱动互动。
Gemini API 更新日志显示,Veo 新增 4k 输出分辨率,并在所有分辨率下增加对竖屏视频的支持。
Gemini API 上线模型生命周期功能,部分模型将标注所处生命周期阶段及弃用时间线。官方同步发布 Model stages 文档说明相关细节。
SGLang 推出 Encoder-Prefill-Decode(EPD)分离架构,将视觉编码从语言处理中拆出,编码器服务器可独立横向扩展,并兼容现有 PD 分离形成三层架构。
伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,在彩色摄影、射电天文、无透镜成像和显微成像四个领域预测下游解码性能。该方法在 NeurIPS 2025 论文中展示,优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器。
ElevenLabs 发布语音转写模型 Scribe v2,专为批量转写、字幕和口播场景设计,宣称在行业标准基准上取得最低词错率,并改进对长音频、停顿、语调变化和长静音的处理。
Qwen 团队发布 Qwen3-VL-Embedding 和 Qwen3-VL-Reranker,面向新一代多模态检索。该系列是 2025 年 6 月开源的文本导向 Qwen3-Embedding 与 Qwen3-ReRanker 的延续,后者在多语言文本检索、聚类和分类等任务中表现出色并被社区广泛采用。
Gemini API 新增 Cloud Storage 存储桶及公有、私有数据库预签名 URL 作为数据输入源,文件大小上限从 20MB 提升至 100MB。具体用法可参见文件输入方法指南。
千问发布 Qwen-Image 文生图基础模型的 12 月更新版 Qwen-Image-2512,可在 Qwen Chat 试用。相比 8 月发布的 Qwen-Image 基础模型,新版本显著减少“AI 生成感”,大幅提升人物真实感。
千问推出 Qwen-Image-Edit-2511,作为 Qwen-Image-Edit-2509 的增强版本,在多项能力上有所改进,其中一致性提升尤为明显。用户可在 Qwen Chat 中选择图像编辑功能体验该模型,线上版本针对速度做了优化,官方建议本地部署以获得最佳性能。
MiniMax 发布 MiniMax-M2.1 模型并开源权重,重点提升 Rust、Java、Golang、C++、Kotlin 等多语言编程能力和原生 Android/iOS 开发能力。
推荐理由:官方说明 M2.1 相比 M2 的能力变化重点和使用入口,读者可据此判断它在多语言编程和办公场景中的适配价值。
Qwen3-TTS 家族发布两款新模型:语音克隆模型 Qwen3-TTS-VC-Flash 和语音设计模型 Qwen3-TTS-VD-Flash,均通过 Qwen API 开放使用。其中 Qwen3-TTS-VD-Flash 支持复杂自然语言指令,可对音色、韵律、情感等做细粒度控制。
SpecForge 团队联合蚂蚁集团、美团、Nex-AGI 和 EigenAI 发布 SpecBundle(Phase 1),提供覆盖 8B 到 1T 参数主流 instruct 模型的生产级 EAGLE3 草稿模型权重,最高可达 4 倍端到端推理加速。
Linear 发文讨论“用代码做设计”之争,认为把设计等同于代码是过度简化,真正的问题是 AI 与新工具下设计师和工程师的角色如何演变,是否会出现“head of craft”这类新职位。文章主张先厘清问题本身再谈方案,并指出代码虽是软件的载体,但并非所有决策都应在代码中做出。
Qwen 团队发布 Qwen-Image-Layered 模型,可将一张图像分解为多个 RGBA 图层,实现原生可编辑性。每个图层可独立操作而不影响其他内容,并原生支持缩放、重定位和重新着色等高保真基础操作。
Sierra 发布 Workspaces,将 GitHub、Figma 式的协作模式引入 AI 智能体开发,支持团队成员在各自 Workspace 中并行构建、测试,再通过合并生成快照并发布到 QA、staging 或生产环境。
Ant Group DeepXPU 团队与 SGLang 团队在 SGLang 中实现扩散大语言模型(dLLM)框架,Day-0 支持 LLaDA 2.0。方案复用现有 Chunked-Prefill 机制,无需改动 SGLang 核心架构,支持自定义扩散解码算法、流式输出、张量并行和 CUDA graph 优化。
推荐理由:原文给出基于 Chunked-Prefill 实现 dLLM 支持的设计细节和实测吞吐数据,读者可据此评估 SGLang 上扩散模型的推理可行性。
Gemini API 在 v1beta 的 Interactions API 中引入一项破坏性变更,将 total_reasoning_tokens 字段更名为 total_thought_tokens,以更贴合思考型模型中"thoughts"的概念。该改动已于 12 月 19 日生效,使用该字段的开发者需相应调整代码。
Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上对 Mistral OCR 2 取得 74% 的整体胜率,输出支持带 HTML 表格重建的 markdown。
推荐理由:官方给出了对比 Mistral OCR 2 的胜率、价格和 API 入口,读者可以据此评估文档解析方案的替换成本。
LMSYS 推出源自 SGLang 的轻量级推理框架 Mini-SGLang,代码仅 5k 行 Python,保留 Radix Attention、Chunked Prefill、Overlap Scheduling、Tensor Parallelism 等核心优化,并提供 OpenAI 兼容 API 和开箱即用的 Llama-3、Qwen-3 支持。
推荐理由:官方介绍这款仅 5k 行代码的推理引擎保留了哪些关键优化,以及如何用它学习和做研究原型。
Google 在 Gemini API 更新日志中宣布推出 Gemini 3 Flash Preview(gemini-3-flash-preview),定位为以更低成本提供对标更大模型的快速前沿性能。新模型升级了视觉与空间推理以及智能体编码能力,并附带多模态函数响应、带图像的代码执行等新功能文档。
推荐理由:官方日志给出新模型的定位、成本与新增功能入口,便于评估其在现有 Gemini API 工作流中的替换价值。