Random Attention:重新思考高效推理的 KV Cache 淘汰策略
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
论文提出 Random Attention,一种不计算任何分数、在每个注意力头内均匀随机淘汰 KV cache 的方法。在四个模型和六个推理任务上,它的任务表现持平最强基线,用 vLLM 部署时吞吐比该方法高 32-43%。
来源:Hugging Face Daily Papers · arxiv.org