SGLang 在 NVIDIA GTC 2026 的活动亮点回顾
SGLang 在 NVIDIA GTC 2026 期间举办五场活动,包括黄仁勋 GTC 主题演讲的 NVIDIA AI 生态幻灯片展示、开源 AI 专题讨论、官方训练实验室,以及与 RadixArk 联合举办的 Happy Hour 和 LinkedIn 约 200 人规模的 meetup。
SGLang 在 NVIDIA GTC 2026 期间举办五场活动,包括黄仁勋 GTC 主题演讲的 NVIDIA AI 生态幻灯片展示、开源 AI 专题讨论、官方训练实验室,以及与 RadixArk 联合举办的 Happy Hour 和 LinkedIn 约 200 人规模的 meetup。
Sierra 宣布收购东京企业 AI 初创公司 Opera Tech,其联合创始人 Keita Morikawa 与 Kiyohito Kunii 将一同加入。Sierra 称此举旨在拓展日本市场,并援引 Singtel 10 周上线、解决率超 70%,以及 Rocket Mortgage 月贷款规模达 $1B 等客户案例。
Sierra 推出以智能体构建智能体为核心的重构产品 Ghostwriter,用户上传 SOP、客服通话记录、白板草图等素材或用英文描述需求,即可生成支持语音、聊天、邮件和 30 多种语言、自带护栏的生产级智能体。
Suno 发布 v5.5 模型,同时推出三项个性化功能。Voices 让用户采集自己的声音来创作音乐,包含验证流程且默认私密,面向 Pro 和 Premier 订阅者;Custom models 可基于自有曲目调出个性化模型,最多可建三个;My Taste 根据用户偏好学习风格,面向所有用户。官方称这些能力为今年晚些时候与音乐行业合作推出的新一代音乐模型打基础。
推荐理由:原文交代了新功能的具体机制与订阅限制,读者可据此判断如何用自己的声音和风格来创作音乐。
Google 推出 Vibe Coding XR 工作流,通过专门的系统提示词与 XR Blocks 代码模板,让 Gemini 将自然语言在 60 秒内转为可运行的、支持物理感知的 Android XR 应用。
Google Research 发布压缩算法 TurboQuant,可在零精度损失下大幅压缩模型,兼顾 KV cache 压缩与向量搜索,将亮相 ICLR 2026。
Sierra 宣布在澳大利亚悉尼开设办公室,此前已扩展至新加坡、东京、马德里、巴黎和伦敦。其平台上的 AI 智能体支持 30 多种语言、全天候无等待服务,覆盖产品发现、注册登录、故障排查和流失管理。Rocket Mortgage 每月贷款量达 $1BN,使用其智能体的购房者完成流程的可能性高出四倍。
Mistral AI 发布 4B 参数的文本转语音模型 Voxtral TTS,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,API 定价 $0.016 per 1k characters。
推荐理由:官方给出了与 ElevenLabs 对比的人类评测数据和低延迟指标,读者可据此评估其在语音 Agent 场景的可用性。
Microsoft AI 团队发布图像生成模型 MAI-Image-2,称其使 MAI 进入 Arena.ai 榜单前三的文生图实验室行列。
推荐理由:原文给出榜单排名、可用入口和面向创意工作的三大能力重点,读者可据此判断是否试用或接入。
Sierra 发布 𝜏³-Bench,在 𝜏-Bench 基础上新增 𝜏-Knowledge 与 𝜏-Voice 两个评测域,并合入社区对原有 airline、retail、telecom 任务的修复。
Google Research 在 The Check Up 活动上展示了多项医疗 AI 进展,包括与 Fitbit 合作研究的 Personal Health Agent(PHA),发现其比单一任务应用更能支持长期健康。
Google Research 与 NHS 合作开展 AIMS 研究,在 Nature Cancer 发表两篇论文评估 AI 乳腺癌检测系统。回溯评估覆盖约 115,973 名女性的乳房 X 光检查,AI 灵敏度显著高于原第一人类读者,癌症检出率从每千人 7.54 升至 9.33,并检出原双重读片漏掉的 25% 间期癌。
推荐理由:研究给出了AI作为乳腺癌筛查第二读者的端到端验证数据,包括检出率和人力节省的具体结果与仲裁误判风险。
Mistral AI 推出 Forge,一套让企业基于自有专有知识训练前沿级 AI 模型的系统,支持预训练、后训练与强化学习全流程。Forge 同时支持 dense 与 MoE 架构,并可处理多模态输入,模型可在企业自有基础设施内训练与治理。该平台以智能体优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数并生成合成数据。
Mistral 发布 Mistral Small 4,将 Magistral 的推理、Pixtral 的多模态与 Devstral 的智能体编码能力统一到单一开源模型,采用 Apache 2.0 许可证。
推荐理由:官方公布了架构参数、reasoning_effort 用法和与 GPT-OSS 120B 的效率对比,可据此评估其开源部署价值。
Mistral AI 宣布加入 NVIDIA Nemotron Coalition 并担任创始成员,双方计划结合各自架构与算力共同开发前沿开源模型。联盟首个项目是在 NVIDIA DGX Cloud 上训练的基础模型,将支撑即将推出的 NVIDIA Nemotron 4 系列并开源;Mistral AI 同日发布 Mistral Small 4,此前双方曾合作开发 Mistral Nemo。
Google 与康奈尔大学合作,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家盲评打分。NotebookLM 在多数维度表现突出,自建 RAG 系统紧随其后,两者与 Gemini 在观点平衡性和答案全面性上排名前三。
Miles 开源强化学习框架现已支持 ROCm,可在 AMD Instinct MI300/350 系列 GPU 上原生运行大规模 RL 后训练。该框架基于 SGLang 和 Slime 生态,支持 GRPO/PPO、Ray 编排及 Megatron-LM 集成,并提供预构建容器。
Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,权重以 Apache 2.0 许可开放,采用 120B-A6B 稀疏架构,并可通过 Mistral Vibe 和 labs-leanstral-2603 API 端点使用。
伯克利 AI 研究提出 SPEX 与 ProxySPEX 算法,用于在大规模 LLM 中识别驱动模型输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约 10 倍更少的消融达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,而 LIME、Banzhaf 等边际方法忠实度明显更低。
Linear 发布视觉界面改版,通过调暗导航侧边栏、压缩顶部标签、减少图标使用并软化边框对比,让主内容区更突出。改版借助内置 dev toolbar 一键切换 feature flags 对比新旧版本,并用 Claude Code 在数小时内构建出可调 hue、chroma、lightness 的颜色工具,其 token 值以 JSON 导入 Figma。
对话式 AI 平台 Sierra 宣布在西班牙马德里开设办公室,并已与多家西班牙大型企业合作构建 AI 客户体验。Sierra 智能体可覆盖产品推荐、注册、账户管理、故障排查、忠诚度计划与流失管理等场景;英国零售商 Next 六周上线,覆盖 83 个国家 48 种语言,Cigna 八周投产并将患者认证时间缩短 80%,Singtel 十周上线,解决率超 70%。
Google Research 宣布在 Flood Hub 上推出城市山洪预报,借助基于 Gemini 的 Groundsource 方法从新闻报告中提取历史山洪数据,用 LSTM 模型提前 24 小时预测城市山洪风险。
推荐理由:原文给出 Flash Flood 预报的技术路线和与 NWS 的对比指标,读者可以了解 AI 预警如何弥补全球南方的预警缺口。
Microsoft 推出 Copilot Health,这是 Copilot 内的独立安全空间,可整合健康记录、可穿戴设备数据与健康历史并生成个性化健康洞察。
推荐理由:官方宣布 Copilot Health 上线并给出数据整合规模、隐私隔离措施和分阶段开放方式,读者可以了解其功能边界与使用入口。
Runway 发文说明其本周发布的实时视频智能体 API Runway Characters 的安全考量,该产品基于 World Model GWM-1,可从单张图像生成可对话的定制角色。
Runway 宣布成立内部孵化器 Runway Labs,专注探索生成式视频与 General World Models 的下一代应用。该孵化器由联合创始人兼首席创新官 Alejandro Matamala Ortiz 领导,负责孵化处于 AI 视频前沿的实验性产品。Runway 同时启动招聘,招募设计、ML、全栈及 AI 工程师与创业者。
Mistral 构建了一个自主智能体,读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行,基于开源编码助手 Vibe 搭建,通过 AGENTS.md、分类 skills 文件和 RuboCop、SimpleCov 自定义工具实现。
推荐理由:原文完整给出了用 Vibe 搭建 Rails 测试智能体的方法,AGENTS.md、skills 和自纠工具的做法可迁移复用。
SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。
推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。
Microsoft AI 分析 2026 年 1 月超过 50 万条 Copilot 健康与 wellbeing 相关对话,发现近 1/5 对话涉及用户描述自身症状、解读检查结果或管理病情,约 40% 的问题聚焦症状、疾病和治疗信息。
SGLang 团队与 NVIDIA 合作宣布,在 SemiAnalysis InferenceXv2 基准上,SGLang 运行 DeepSeek R1 在 GB300 NVL72 上相比 H200 实现最高 25x 性能提升,同时不到 4 个月内将 GB200 NVL72 上的性能提升最高 8x。
SGLang 在 GB300 NVL72 上部署 DeepSeek R1-NVFP4,128K/8K 长上下文场景下实现 226.2 TPS/GPU,较 GB200 提升 1.53X;相同吞吐下 MTP 使用户吞吐再提升 1.87X。
SGLang-Diffusion 公布面向生产级视频生成的进阶优化,覆盖并行策略、VAE、服务稳定性与 I/O。序列并行从帧级改为 token 级分片,在 8×H100 上把填充开销从 3 帧(14.3%)降到 0,all-to-all 通信量降至 0.875×。同时为 Wan-VAE 实现按高度分片的并行编解码,并修复 Cache-DiT 在多请求服务下的缓存污染与崩溃问题。
Sierra 构建了 Multi-Model Router(MMR)与拥塞感知的 provider 选择器两层基础设施,在 provider 出现限流或容量波动时保持 Agent 行为一致。
千问 C 端基础设施工程团队与 AMD AI 框架团队基于 SGLang,在 AMD Instinct MI300X 系列 GPU 上对 Qwen3-235B 和 Qwen3-VL-235B 完成极端延迟优化。
Sierra 创始人 Bret Taylor 与 Clay Bavor 发布第二年度复盘,公司继七个季度达成 1 亿美元 ARR 后迎来首个 5000 万美元季度,进入第三年时 ARR 超过 1.5 亿美元。
Suno 为 Premier 订阅者的 Suno Studio 推出 1.2 版本,新增 Remove FX 可去除音频片段效果并导出无效果版本至 DAW,Warp Markers 支持配合 Quantize 调整音频时序与律动。该版本还引入 Alternates 优化 take lanes 试听流程,并支持 4/4 以外的拍号,如 6/8、7/8 和 11/4。
Mistral 发布 Voxtral Transcribe 2 系列,包含 Voxtral Mini Transcribe V2(批量转写)和 Voxtral Realtime(实时转写),支持 13 种语言的说话人分离、上下文偏置和词级时间戳。
推荐理由:官方给出了两个语音转写模型的具体延迟、错误率和价格,并开放了 Voxtral Realtime 权重,便于按场景选型。
Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选澄清、斜杠命令技能和统一智能体模式。
推荐理由:官方公告给出 2.0 的功能清单、订阅方案和 Devstral 2 API 定价,读者可以据此评估是否把它纳入自己的终端开发工作流。
SGLang RL 团队联合 InfiXAI、蚂蚁集团等团队,在 slime 框架上落地了 INT4 QAT 端到端方案,训练用 fake quantization、推理用 W4A16,实现与 BF16 全精度相当的训练-推理一致性。
Sierra 发布 Expert Answers,可将 AI 智能体转交人工解决的客服对话自动生成可审核的知识文章,并回灌给智能体。该功能会识别智能体的知识缺口、学习相似问题的解决模式并生成草稿,供客服团队审核而非从零撰写。一家数字健康公司用其生成的文章测试部分流量,解决率提升 4% 且未增加客服工作量,随后全面铺开。
Mistral AI 团队在预生产测试中发现,使用 vLLM 部署 Mistral Medium 3.1 并开启 graph compilation 的 Prefill/Decode 分离式推理下,系统内存以每分钟 400 MB 的速度线性增长,最终导致 out of memory。