跳到正文
Hugging Face Daily Papers·· 2026-08-25AI 评分43

量化感知修复 QAH:从 GPT-OSS 120B 压缩到 60B MXFP4 的 4-bit LLM 恢复方案

Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究团队提出量化感知修复(QAH),将 4-bit 学生模型直接从原始未压缩模型蒸馏,替代默认的量化感知训练(QAT)。在 GPT-OSS 120B 到 60B 再到 MXFP4 的流水线上,QAH 学生模型在 9 项基准中的 7 项追平或超过其 bfloat16 源模型,权重内存约为原来的 1/4,参数量为教师模型的一半,并以 Hypernova-60B 开源发布。

来源:Hugging Face Daily Papers · arxiv.org