如何在不降低智能的前提下压缩语言模型
How to Shrink a Language Model Without Making it Too Dumb
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
一个 70B 参数模型以 16 位存储需约 140 GB,而消费级显卡显存仅 24 GB 或 48 GB,模型规模几年间增长约 100 倍而显存仅翻倍。文章介绍三种压缩技术:量化(用更少位数存储每个权重)、剪枝(删除无贡献的权重)和知识蒸馏(用小模型模仿大模型行为),并讨论压缩是否会损害模型智能。
来源:ByteByteGo · blog.bytebytego.com