Together AI 发布 Dedicated Container Inference,自定义模型推理提速 2.6x
Together AI 推出 Dedicated Container Inference,用户自带 Docker 容器部署视频生成、数字人等自定义生成式媒体模型,平台负责自动扩缩容、排队、流量隔离和监控。
媒体报道、公司博客与研究文章
Together AI 推出 Dedicated Container Inference,用户自带 Docker 容器部署视频生成、数字人等自定义生成式媒体模型,平台负责自动扩缩容、排队、流量隔离和监控。
ElevenLabs 正式发布 ElevenLabs for Government,为公共部门提供语音与聊天智能体,支持 24/7 多语言服务。该方案已在乌克兰、捷克和美国得州 Midland 落地:捷克福利与就业热线智能体每天处理约 5,000 通电话,独立解决约 85% 的来电,并将接通率从约 60% 提升至近乎全覆盖;Midland 预计每月减少约 7,000 通未接来电。
Klarna 与 ElevenLabs 合作,在美国上线基于 ElevenAgents 的语音 AI 客服,作为 3500 万美国用户电话支持的第一线,查询解决速度最高快 10 倍。Agent 处理咨询类请求并可在必要时转接人工;Klarna 看重 GDPR 合规、超低延迟与可编排分析能力,下一步计划推广至全球 1.14 亿用户。
千问 C 端基础设施工程团队与 AMD AI 框架团队基于 SGLang,在 AMD Instinct MI300X 系列 GPU 上对 Qwen3-235B 和 Qwen3-VL-235B 完成极端延迟优化。
千问(Qwen)团队发布下一代图像生成基础模型 Qwen-Image-2.0。核心亮点包括专业排版渲染,支持 1k token 指令直接生成 PPT、海报、漫画等专业信息图;更强的语义遵从能力,原生支持 2K 分辨率生成精细写实场景。
推荐理由:原文列出了排版渲染和语义遵从两项核心能力,可帮助读者判断其在信息图和写实场景上的适用性。
Sierra 创始人 Bret Taylor 与 Clay Bavor 发布第二年度复盘,公司继七个季度达成 1 亿美元 ARR 后迎来首个 5000 万美元季度,进入第三年时 ARR 超过 1.5 亿美元。
Suno 为 Premier 订阅者的 Suno Studio 推出 1.2 版本,新增 Remove FX 可去除音频片段效果并导出无效果版本至 DAW,Warp Markers 支持配合 Quantize 调整音频时序与律动。该版本还引入 Alternates 优化 take lanes 试听流程,并支持 4/4 以外的拍号,如 6/8、7/8 和 11/4。
Mistral 发布 Voxtral Transcribe 2 系列,包含 Voxtral Mini Transcribe V2(批量转写)和 Voxtral Realtime(实时转写),支持 13 种语言的说话人分离、上下文偏置和词级时间戳。
推荐理由:官方给出了两个语音转写模型的具体延迟、错误率和价格,并开放了 Voxtral Realtime 权重,便于按场景选型。
ElevenLabs 完成 5 亿美元 D 轮融资,估值 110 亿美元,较一年前增长超过三倍,累计融资达 7.81 亿美元。本轮融资由 Sequoia Capital 领投,Andrew Reed 加入董事会,A16Z 加注四倍、ICONIQ 加注三倍。
推荐理由:官方公告给出了融资金额、估值、ARR 和资金用途,读者可以据此了解 ElevenLabs 在语音智能体上的投入方向。
Qwen 团队发布开源权重模型 Qwen3-Coder-Next,专为编码智能体和本地开发设计。模型基于 Qwen3-Next-80B-A3B-Base 构建,采用混合注意力加 MoE 的新架构,通过大规模可执行任务合成、环境交互和强化学习进行 agentic 训练。
推荐理由:原文说明该模型面向编码智能体与本地开发,并给出混合注意力加 MoE 的架构与训练方式,读者可据此评估其定位。
ElevenLabs 宣布其最先进的 Text to Speech 模型 Eleven v3 结束 Alpha,正式全面可用。测试中新版本相较 Alpha 被 72% 的用户偏好;基于覆盖 8 种语言 27 个类别的内部基准,错误率从 15.3% 降至 4.9%,下降 68%,显著改进了数字、符号和专用记号(如电话号码、货币、化学式、比分)的读法。模型现已在所有平台开放。
推荐理由:官方给出了语音模型稳定性与符号读法准确率的具体数据,可据此判断其在多语言场景的可用性。
Arvind Narayanan 在其新文章和视频中逐条考证 Moravec 悖论(对人类难的任务对 AI 容易、反之亦然),指出它从未被实证检验,本质是 AI 社区认为值得研究的问题造成的筛选效应,其演化解释也很可疑。
ElevenLabs 与 Audi Revolut F1 Team 达成合作,将用 AI 音频与语音生成技术为车队打造跨文化、可规模化的数字内容。Audi Revolut F1 Team 首席商务官 Stefano Battiston 称 ElevenLabs 是 AI 语音技术领域的领导者,双方将探索赛道内外的新内容形式与车迷互动方式。
Qwen 团队宣布开源 Qwen3-ASR 系列与 Qwen3-ForcedAligner。系列包含 Qwen3-ASR-1.7B 和 Qwen3-ASR-0.6B 两款一体化语音识别模型,支持语言识别,并带来一款新型非自回归语音强制对齐模型,主打鲁棒性、流式处理和多语言。
Gemini API 宣布在 gemini-3-pro-preview 和 gemini-3-flash-preview 上推出 Computer Use 工具支持,发布于 2026 年 1 月 29 日更新日志。
Revolut 部署 ElevenLabs Agents 作为英国和欧洲客户的语音客服第一线,覆盖超 400 万客户,支持 30 多种语言并实时切换。智能体解决工单不到 5 分钟,此前人工处理平均耗时 8 倍以上,超 99.7% 的通话顺利完成。Revolut 保留编排和业务逻辑控制权,方案满足 PCI 合规与零留存要求,并计划向全球扩展。
Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选澄清、斜杠命令技能和统一智能体模式。
推荐理由:官方公告给出 2.0 的功能清单、订阅方案和 Devstral 2 API 定价,读者可以据此评估是否把它纳入自己的终端开发工作流。
MiniMax 发布面向生产环境的角色扮演模型 MiniMax-M2-her。基于 Talkie/Xingye 三年运营观察,团队将 Role-Play 拆解为 Worlds。
千问发布最新旗舰推理模型 Qwen3-Max-Thinking,通过扩大模型参数并投入大量算力进行强化学习,在事实知识、复杂推理、指令遵循、人类偏好对齐和智能体能力等多个维度实现显著性能提升。
SGLang RL 团队联合 InfiXAI、蚂蚁集团等团队,在 slime 框架上落地了 INT4 QAT 端到端方案,训练用 fake quantization、推理用 W4A16,实现与 BF16 全精度相当的训练-推理一致性。
Sierra 发布 Expert Answers,可将 AI 智能体转交人工解决的客服对话自动生成可审核的知识文章,并回灌给智能体。该功能会识别智能体的知识缺口、学习相似问题的解决模式并生成草稿,供客服团队审核而非从零撰写。一家数字健康公司用其生成的文章测试部分流量,解决率提升 4% 且未增加客服工作量,随后全面铺开。
Qwen 团队宣布开源 Qwen3-TTS 系列语音生成模型。该系列支持语音克隆、语音设计和超高质量拟人生成等能力。
推荐理由:原文给出 Qwen3-TTS 开源与语音克隆、语音设计等能力范围,读者可据此评估它在语音生成场景的可用性。
Mistral AI 团队在预生产测试中发现,使用 vLLM 部署 Mistral Medium 3.1 并开启 graph compilation 的 Prefill/Decode 分离式推理下,系统内存以每分钟 400 MB 的速度线性增长,最终导致 out of memory。
ElevenLabs 推出 The Eleven Album,整张专辑由 Eleven Music 生成,合作艺人包括 Liza Minnelli、Art Garfunkel、KondZilla 等。
Gemini API 于 1 月 21 日调整最新别名,gemini-pro-latest 已切换至 gemini-3-pro-preview,gemini-flash-latest 已切换至 gemini-3-flash-preview。开发者通过这两个别名调用时将自动指向 Gemini 3 系列的预览版本。
Novita AI 基于 SGLang 为 GLM4-MoE 推出一套生产级推理优化方案,通过 Shared Experts Fusion 与 Suffix Decoding 等技术,在 H200 集群 TP8、FP8 配置下将 TTFT 最多降低 65%,智能体编程负载下 TPOT 改善 22%。
SGLang-Diffusion 团队发布发布两个月进展总结,当前版本(docker 镜像 lmsysorg/sglang:dev-pr-17247)比 2025 年 11 月初始版最快提升 2.5 倍,在 NVIDIA GPU 上比其他方案最高快 5 倍。
推荐理由:官方复盘两个月迭代成果,涵盖新模型支持、LoRA 与 ComfyUI 集成等具体改进,读者可评估是否迁移现有扩散推理工作流。
MasterClass 与 ElevenLabs 合作,为其 On Call 产品的 AI 导师提供 Text to Speech 语音能力,Gordon Ramsay、Mark Cuban、Chris Voss 等导师的 AI 版本可与用户实时语音对话。
SGLang 推出高度优化的流水线并行(PP)实现,融合分块流水线并行、异步 P2P 通信与动态分块机制,专为超长上下文推理设计。在 H20 集群上以 PP4 TP8 部署 DeepSeek-V3.1、分块预填充设为 12K 时,预填充吞吐达 TP8 的 3.31 倍,比 TP32 方案高出 30.5%,同时 TTFT 最多降低 67.9%,强扩展效率保持 82.8%。
Gemini API 宣布将于 2026 年 2 月 17 日关停 gemini-2.5-flash-preview-09-25、imagen-4.0-generate-preview-06-06 和 imagen-4.0-ultra-generate-preview-06-06 三个模型。此外,gemini-2.5-flash-image-preview 模型已被关停。
ElevenLabs 与 Deutsche Telekom 宣布合作,将 ElevenLabs 的 AI 语音智能体接入这家欧洲最大电信运营商的客服体系,通过 App 和电话提供服务。Deutsche Telekom 用户将可体验 24/7 在线、无需等待的拟人化语音客服。双方称此举旨在推动 AI 语音技术的普及。
Gemini API 更新日志显示,text-embedding-004 模型已被关停。该模型此前用于文本嵌入向量生成,关停后相关调用将不再可用。
Sierra 与 Stellarus 达成合作,帮助健康计划大规模部署 AI 智能体。双方与 Blue Shield of California 合作推出的 AI 语音智能体上线六个月,可 24/7 回答福利与覆盖范围等会员咨询,在数千次交互中取得 4.4(满分 5)的客户满意度评分。双方下一步将从被动支持转向主动的 AI 驱动互动。
Gemini API 更新日志显示,Veo 新增 4k 输出分辨率,并在所有分辨率下增加对竖屏视频的支持。
Gemini API 上线模型生命周期功能,部分模型将标注所处生命周期阶段及弃用时间线。官方同步发布 Model stages 文档说明相关细节。
SGLang 推出 Encoder-Prefill-Decode(EPD)分离架构,将视觉编码从语言处理中拆出,编码器服务器可独立横向扩展,并兼容现有 PD 分离形成三层架构。
伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,在彩色摄影、射电天文、无透镜成像和显微成像四个领域预测下游解码性能。该方法在 NeurIPS 2025 论文中展示,优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器。
ElevenLabs 发布语音转写模型 Scribe v2,专为批量转写、字幕和口播场景设计,宣称在行业标准基准上取得最低词错率,并改进对长音频、停顿、语调变化和长静音的处理。
Qwen 团队发布 Qwen3-VL-Embedding 和 Qwen3-VL-Reranker,面向新一代多模态检索。该系列是 2025 年 6 月开源的文本导向 Qwen3-Embedding 与 Qwen3-ReRanker 的延续,后者在多语言文本检索、聚类和分类等任务中表现出色并被社区广泛采用。
Gemini API 新增 Cloud Storage 存储桶及公有、私有数据库预签名 URL 作为数据输入源,文件大小上限从 20MB 提升至 100MB。具体用法可参见文件输入方法指南。