跳到正文
@AYi_AInotes· @AYi_AInotes · X·· 2026-08-31AI 评分40
AI 导读

Baseten 公布 Agentic Kernel 生产级落地的 6 条底层军规,并给出 SGLang + B300 实战数据:Qwen-Image 端到端延迟降低 42.3%(FP8/NVFP4 混合优化),FLUX.2 降低 15.2%,MiniMax M3 在 vLLM 上吞吐提升 5.5% tok/s。

正文

Baseten Agentic Kernel 生产级落地的 6 条底层军规与干货清单 👇

1️⃣ 真实生产战报(SGLang + B300 落地):
- Qwen-Image:端到端延迟降低 42.3%(FP8/NVFP4 混合优化)
- FLUX.2:端到端延迟降低 15.2%
- MiniMax M3 (vLLM):吞吐提升 5.5% tok/s(扩散模型比被手工抠烂的成熟 LLM 拥有多得多的图级冗余)

2️⃣ 核心优化三刀(全链路 bit-identical 数值保真):
① 预打包 FP8 Scales:权重 scale 改为加载时打包一次,生产者直接吐 packed 格式(延迟 -7.3%)。
② CFG Modulation Cache:针对 Classifier-free guidance 共享分支做 block 内缓存,消灭无意义的重复计算(延迟 -3.1%)。
③ 深度算子融合:Norm + Quant + QKV 投影 + RoPE 一趟做完,彻底消除 BF16 中间张量反复落盘的显存暗税。

3️⃣ 系统工程师必带走的 6 条军规:
- 先看计算图,再看单算子:40%+ 的提速从来不是抠单个 Kernel,而是消灭根本不该存在的 Launch 和中间张量。
- 生产约束远比 FLOPs 严苛:CUDA Graph、多 Stream、Contiguity Guard 会把孤立基准的胜利瞬间作废。
- 格式转换是隐形吸血鬼:Scale 反复 Pack、cos/sin 反复 Concat 是吞噬吞吐的大头。
- 上线优化首选 bit-identical:只有不改变数值逻辑的等价替换,才敢不经人工反复核验直接进生产。
- 扩散模型是当前最好的算力富矿:DiT 架构的图级优化空间远大于成熟 LLM。
- 壁垒是自进化知识库:Agent 会写 Triton 不值钱,懂得把每次上线/踩坑经验沉淀进向量库的闭环才值钱。

来源:@AYi_AInotes · x.com