跳到正文
Hugging Face Blog·· 2026-08-10AI 评分44

Hugging Face 提出离线 Top-K Logits 与融合分块 KL 损失,让知识蒸馏低成本跑在大规模场景

Making Knowledge Distillation Cheap Enough to Run at Scale

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

Hugging Face 最新论文提出两项系统改动降低 LLM 知识蒸馏成本:一是离线缓存教师模型每位置的 top-100 logits,训练时无需再加载教师;二是融合分块 KL 损失,避免生成完整的词表×序列长度矩阵。以 gpt-oss-120b 为例,稠密 KL 峰值约 250GB 显存,融合分块方案峰值约 128GB,使长上下文修复可在单 GPU 上完成。

来源:Hugging Face Blog · huggingface.co