SparseDecoding:面向解码感知的 LLM 剪枝框架,实现最高 1.48 倍解码加速
SparseDecoding: Decoding-Aware Pruning for Accurate and Efficient LLM Inference
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
SparseDecoding 是一个解码感知的 LLM 剪枝框架,通过用稠密模型自回归生成(排除 prefill)的逐层激活构建校准矩阵,使剪枝目标与解码激活对齐,并配套带 bitmask 索引和固定步长遍历的 N:M 稀疏矩阵-向量内核。
来源:Hugging Face Daily Papers · arxiv.org