AI 导读
推文用文档+LLM 办公场景解释三个概念:Prefill 负责处理 input,KV cache 保存计算得到的 K/V 供后续生成使用,Prefix caching 则只能复用首次 token 变化之前的共同 prefix。示例中 A、B 两次请求共享文档前缀,C 因文档被修改,只能复用改动前的共同部分。
正文
三个重要的概念, Prefill, KV cache, Prefix caching
例如,在文档+LLM 的办公场景:
A: 文档 +“帮我看看,有哪些风险?”
B: 文档+“预算减半,帮我调整一下。”
C:修改后文档+“再看看,现在的预算够不够?”
Prefill:处理 input。
KV cache:保存状态。 留下计算得到的 K/V,供后续生成使用。
Prefix caching:C 的输入方案已改变,只能复用首次 token 变化之前的共同 prefix。
https://t.co/1Zp3Skkv39在 X 查看被引用的帖子
来源:@dongxi_nlp · x.com