清华团队详解大模型推理加速全链路:从 FlashTensor、KV Cache 到 FastDecode 与赤兔引擎
大模型推理加速全链路:内存管理、编译优化、量化与并行策略
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
清华大学助理研究员金煜阳在 QCon 北京站分享了大模型推理加速的全链路工作,覆盖算子优化、KV Cache 内存管理、混合精度量化、CPU-GPU 异构调度与自适应并行策略。
来源:InfoQ · 微信公众号 · mp.weixin.qq.com
大模型推理加速全链路:内存管理、编译优化、量化与并行策略
本站未展示全文,请前往来源网站阅读。
清华大学助理研究员金煜阳在 QCon 北京站分享了大模型推理加速的全链路工作,覆盖算子优化、KV Cache 内存管理、混合精度量化、CPU-GPU 异构调度与自适应并行策略。
来源:InfoQ · 微信公众号 · mp.weixin.qq.com