跳到正文
Hugging Face Daily Papers·· 2026-09-04AI 评分51

Random Attention:重新思考高效推理的 KV Cache 淘汰策略

Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

论文提出 Random Attention,一种不计算任何分数、在每个注意力头内均匀随机淘汰 KV cache 的方法。在四个模型和六个推理任务上,它的任务表现持平最强基线,用 vLLM 部署时吞吐比该方法高 32-43%。

来源:Hugging Face Daily Papers · arxiv.org