inclusionAI 发布 LLaDA2.0-Uni-FP8 量化版:MoE 专家权重块级 FP8,加载显存降约 48%
inclusionAI/LLaDA2.0-Uni-FP8
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
inclusionAI 发布 LLaDA2.0-Uni 的 FP8 量化版本 LLaDA2.0-Uni-FP8,对 MoE 路由专家权重(gate_proj、up_proj、down_proj)做 128×128 块级 FP8(float8_e4m3fn)量化,模型加载显存从 62.9 GB 降至 32.5 GB,减少约 48%,输出质量保持不变。
来源:inclusionAI Hugging Face models · huggingface.co