LLM 的 KV cache 为何昂贵,以及如何优化
Why An LLM’s Memory Gets Expensive and How to Fix It
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
LLM 长上下文推理的成本主要来自 KV cache:它随 token 数和批量大小线性增长,解码阶段每生成一个 token 都要读取整个缓存,缓存越大带宽开销越高。
来源:ByteByteGo · blog.bytebytego.com
Why An LLM’s Memory Gets Expensive and How to Fix It
本站未展示全文,请前往来源网站阅读。
LLM 长上下文推理的成本主要来自 KV cache:它随 token 数和批量大小线性增长,解码阶段每生成一个 token 都要读取整个缓存,缓存越大带宽开销越高。
来源:ByteByteGo · blog.bytebytego.com