AMD MI355X 如何借 SGLang 与 MoRI 实现 DeepSeek-R1 分布式推理的成本竞争力
AMD 与 SGLang 团队联合优化,使 MI355X 在 DeepSeek-R1 大规模分离式推理中实现 129 tok/s/user 交互性下每百万 token $0.169 的成本,比 B200 TRT-LLM 低 5%,单 GPU 吞吐比 B200 SGLang 高 1.25 倍,结果由 SemiAnalysis 的 InferenceX 持续基准验证。
AMD 与 SGLang 团队联合优化,使 MI355X 在 DeepSeek-R1 大规模分离式推理中实现 129 tok/s/user 交互性下每百万 token $0.169 的成本,比 B200 TRT-LLM 低 5%,单 GPU 吞吐比 B200 SGLang 高 1.25 倍,结果由 SemiAnalysis 的 InferenceX 持续基准验证。
Sierra 构建了一套语音转录平台,通过并行调用多个转录提供商进行集成、注入对话上下文,并支持 70+ 种语言,以解决姓名拼写歧义、行业术语识别等难题。其内部基准显示,集成方案平均将话语错误率降低约 25%,在部分语言中最高降低 37%;上下文感知转录使金融服务智能体的输入验证率提升超 25%,整体问题解决率最高提升 1%,重大转录错误减少最多 15%。
Runway 工程团队通过一个三行模块的四种并行尝试,展示手工分布式训练中梯度易出静默错误的根因,并说明 PyTorch DTensor 如何用 placement 元数据自动插入正确的 collective 来保证正确性。
Sierra 提出"上下文工程"是构建复杂 AI 智能体的核心,即决定智能体在每个时刻能访问哪些信息、何时使用。其平台通过渐进式披露机制,仅在条件满足时向智能体提供最少且最相关的信息,避免无关 token 分散模型注意力。
Runway 构建了 NCCLBack 系统,让新 GPU worker 直接从已加载权重的对等节点通过 GPU 互联接收权重,而非从云存储重复下载,将模型冷启动时间从数分钟缩短到数秒,冷启动时间不再随集群规模线性增长。该系统基于 NCCL broadcast 原语,配合 Redis 队列做节点发现,并包含传输与完整性校验层。
SGLang 为 RL 工作负载引入基于 RDMA 的 P2P 权重更新机制,通过 Mooncake TransferEngine 传输,将 1T 参数 Kimi-K2 的权重传输从 53 秒缩短至 7.2 秒,提速 7 倍,代价是每个训练 rank 额外占用 32G CPU 内存的推理引擎副本。
Runway 将 Kueue 作为 Kubernetes 准入控制器管理多团队共享的 GPU 集群,在保证团队预留容量的同时把 GPU 利用率提升超过 20 个百分点。
Sierra 取消编码和算法面试,改为 AI 原生 onsite,候选人先与面试官共同定义产品,再用 2 小时自由使用 AI 工具构建,最后演示并复盘代码与产品取舍。公司同时用系统设计面试取代编码电话筛,并试点调试面试考察 1 到 N 的改进能力;作者称新流程信号更丰富,候选人反馈更投入,但开放式设计带来标准化难题,需配套评估标准和双人面试来校准。
推荐理由:Sierra 作者亲历重构招聘流程,给出了可迁移的 AI 原生面试设计与权衡细节。
Linear 发布视觉界面改版,通过调暗导航侧边栏、压缩顶部标签、减少图标使用并软化边框对比,让主内容区更突出。改版借助内置 dev toolbar 一键切换 feature flags 对比新旧版本,并用 Claude Code 在数小时内构建出可调 hue、chroma、lightness 的颜色工具,其 token 值以 JSON 导入 Figma。
Mistral 构建了一个自主智能体,读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行,基于开源编码助手 Vibe 搭建,通过 AGENTS.md、分类 skills 文件和 RuboCop、SimpleCov 自定义工具实现。
推荐理由:原文完整给出了用 Vibe 搭建 Rails 测试智能体的方法,AGENTS.md、skills 和自纠工具的做法可迁移复用。
SGLang 在 GB300 NVL72 上部署 DeepSeek R1-NVFP4,128K/8K 长上下文场景下实现 226.2 TPS/GPU,较 GB200 提升 1.53X;相同吞吐下 MTP 使用户吞吐再提升 1.87X。
SGLang-Diffusion 公布面向生产级视频生成的进阶优化,覆盖并行策略、VAE、服务稳定性与 I/O。序列并行从帧级改为 token 级分片,在 8×H100 上把填充开销从 3 帧(14.3%)降到 0,all-to-all 通信量降至 0.875×。同时为 Wan-VAE 实现按高度分片的并行编解码,并修复 Cache-DiT 在多请求服务下的缓存污染与崩溃问题。
Sierra 构建了 Multi-Model Router(MMR)与拥塞感知的 provider 选择器两层基础设施,在 provider 出现限流或容量波动时保持 Agent 行为一致。
千问 C 端基础设施工程团队与 AMD AI 框架团队基于 SGLang,在 AMD Instinct MI300X 系列 GPU 上对 Qwen3-235B 和 Qwen3-VL-235B 完成极端延迟优化。
SGLang RL 团队联合 InfiXAI、蚂蚁集团等团队,在 slime 框架上落地了 INT4 QAT 端到端方案,训练用 fake quantization、推理用 W4A16,实现与 BF16 全精度相当的训练-推理一致性。
Mistral AI 团队在预生产测试中发现,使用 vLLM 部署 Mistral Medium 3.1 并开启 graph compilation 的 Prefill/Decode 分离式推理下,系统内存以每分钟 400 MB 的速度线性增长,最终导致 out of memory。
Novita AI 基于 SGLang 为 GLM4-MoE 推出一套生产级推理优化方案,通过 Shared Experts Fusion 与 Suffix Decoding 等技术,在 H200 集群 TP8、FP8 配置下将 TTFT 最多降低 65%,智能体编程负载下 TPOT 改善 22%。
SGLang 推出高度优化的流水线并行(PP)实现,融合分块流水线并行、异步 P2P 通信与动态分块机制,专为超长上下文推理设计。在 H20 集群上以 PP4 TP8 部署 DeepSeek-V3.1、分块预填充设为 12K 时,预填充吞吐达 TP8 的 3.31 倍,比 TP32 方案高出 30.5%,同时 TTFT 最多降低 67.9%,强扩展效率保持 82.8%。
SGLang 推出 Encoder-Prefill-Decode(EPD)分离架构,将视觉编码从语言处理中拆出,编码器服务器可独立横向扩展,并兼容现有 PD 分离形成三层架构。
Linear 客户体验团队将 Intercom、Slack、X、Reddit 等渠道的客户反馈通过 Linear-Intercom 集成和 Linear Asks 模板转为 Linear issue,分别进入工程与产品 triage 队列。
Linear 推出持续规划(continuous planning)流程,让产品团队在想法到来时即整理为候选项目,而非每季度面对空白页重新规划。2025 年起该流程引入 AI 维护项目,智能分诊建议可识别新需求是否与现有 issue 重复或归属同一项目。
Linear 复盘上月推出的 Triage Intelligence 的构建过程,该功能用搜索、排序和 LLM 推理为新 issue 标记重复、关联相关 issue,并推荐标签或负责人等属性。
Mistral 用 LoRA 微调 Pixtral-12B 处理卫星图像,在 Aerial Image Dataset(AID)上显著优于基座模型。基座模型在 Playground 与 Stadium 等模糊类别上易混淆,甚至幻觉出不存在的类别名,微调后分类更准确。微调通过 Mistral 微调 API 或 LaPlateforme UI 完成,无需大量超参数调优。
Mistral AI 发布教程,介绍用 LLM As A Judge 评估 RAG 系统的方法。文章讲解 TruLens 提出的 RAG Triad 框架,从上下文相关性。
Mistral AI 推出 TranscriptToPRDTicket 智能体工作流,由 Mistral Large 2 驱动的 PRDAgent 和 TicketCreationAgent 组成,可将会议转录自动生成 PRD 并转化为结构化开发工单,自动在 Linear / Jira 中创建。
Scale AI 在产品与工程团队推动下全员迁移到 Linear,此前各团队分散使用多种工具,导致 issue 重新分配、上下文共享和进度追踪困难。迁移后 Scale 的 bug 解决时间缩短 52%,并借此支撑其 AI 数据产品的快速扩张。
Descript CEO Andrew Mason 分享了一份内部指南,讲述如何把 Linear 用作团队的工作操作系统。指南建议用 Zapier 把 Slack 收藏消息自动转为 Linear issue,并可用 ChatGPT 将消息摘要压缩到 12 词以内;同时推荐用 Raycast 绑定快捷键实现快速建 issue。
Linear 将 Similar Issues 匹配功能推向全部工作空间,用 LLM 生成向量嵌入并在 issue 创建、Triage 和支持集成中提示重复或相关 issue。该功能基于 PostgreSQL 的 pgvector 存储与检索向量,按 workspace ID 分成数百个分区并分别建索引,以支撑数千万条 issue 的余弦相似度查询。