跳到正文
InfoQ · 微信公众号·· 2026-08-19AI 评分40

清华团队详解大模型推理加速全链路:从 FlashTensor、KV Cache 到 FastDecode 与赤兔引擎

大模型推理加速全链路:内存管理、编译优化、量化与并行策略

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

清华大学助理研究员金煜阳在 QCon 北京站分享了大模型推理加速的全链路工作,覆盖算子优化、KV Cache 内存管理、混合精度量化、CPU-GPU 异构调度与自适应并行策略。

来源:InfoQ · 微信公众号 · mp.weixin.qq.com