跳到正文
Hugging Face Daily Papers·· 1 天前AI 评分43

SparseDecoding:面向解码感知的 LLM 剪枝框架,实现最高 1.48 倍解码加速

SparseDecoding: Decoding-Aware Pruning for Accurate and Efficient LLM Inference

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

SparseDecoding 是一个解码感知的 LLM 剪枝框架,通过用稠密模型自回归生成(排除 prefill)的逐层激活构建校准矩阵,使剪枝目标与解码激活对齐,并配套带 bitmask 索引和固定步长遍历的 N:M 稀疏矩阵-向量内核。

来源:Hugging Face Daily Papers · arxiv.org