跳到正文
@dongxi_nlp· @dongxi_nlp · X·· 23 天前AI 评分35
AI 导读

推文用文档+LLM 办公场景解释三个概念:Prefill 负责处理 input,KV cache 保存计算得到的 K/V 供后续生成使用,Prefix caching 则只能复用首次 token 变化之前的共同 prefix。示例中 A、B 两次请求共享文档前缀,C 因文档被修改,只能复用改动前的共同部分。

正文

三个重要的概念, Prefill, KV cache, Prefix caching

例如,在文档+LLM 的办公场景:

A: 文档 +“帮我看看,有哪些风险?”
B: 文档+“预算减半,帮我调整一下。”
C:修改后文档+“再看看,现在的预算够不够?”

Prefill:处理 input。
KV cache:保存状态。 留下计算得到的 K/V,供后续生成使用。
Prefix caching:C 的输入方案已改变,只能复用首次 token 变化之前的共同 prefix。

引用@dongxi_nlp@dongxi_nlp
https://t.co/1Zp3Skkv39
在 X 查看被引用的帖子

来源:@dongxi_nlp · x.com