BeaconKV:用 Beacon Queries 引导 KV cache 压缩,加速大型推理模型推理
BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
BeaconKV 是一种免训练的 KV cache 压缩方法,通过维护 beacon queries(全局查询簇的紧凑代表)来预判哪些 KV 对会被重新访问,从而避免存储完整查询历史。在四个开源大型推理模型和多个推理基准上,该方法最高实现 5.8 倍内存压缩,几乎保持完整缓存精度,吞吐量提升超过 4.3 倍。该工作已被 ICML 2026 接收。
来源:Hugging Face Daily Papers · arxiv.org