AI 导读
阿易 AI Notes 整理了一份大模型推理工程落地指南,推荐 GitHub 仓库 wafer-ai/gpu-perf-engineering-resources,涵盖 GPU 底层、Roofline 模型、Transformer 算术到分布式推理引擎的工程索引。
正文
📌 落地抄作业指南与核心资源库索引:
1. 学习起点:GitHub 搜索开源仓库 `wafer-ai/gpu-perf-engineering-resources`(非杂乱论文堆,涵盖从 GPU 底层、Roofline 模型、Transformer 算术到分布式推理引擎的完整第一手工程索引);
2. 必读第一篇:Google DeepMind《How To Scale Your Model》Chapter 7: All About Transformer Inference(强烈建议把文中的两道 worked problems 用草稿纸手算一遍,对 $$B_{\mathrm{crit}}$$ 临界 batch 的理解会彻底立住);
3. 架构优化优先级建议:
• 先用 GQA / KV 量化 / 分页把单步显存搬运量压下来;
• 接入 Continuous Batching + 前缀缓存(Prefix Cache)消除调度空转;
• 并发跑满后再考虑上跨机 PD 分离架构,最后一步才去抠手工 Triton/CUDA Kernel。
各位做大模型推理架构的工程师,你们目前线上跑的业务里,主要卡点是首字延迟(TTFT),还是并发上来之后的显存溢出(OOM)?
来源:@AYi_AInotes · x.com