跳到正文
inclusionAI Hugging Face models·· 2026-05-27AI 评分32

inclusionAI 发布 LLaDA2.0-Uni-FP8 量化版:MoE 专家权重块级 FP8,加载显存降约 48%

inclusionAI/LLaDA2.0-Uni-FP8

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

inclusionAI 发布 LLaDA2.0-Uni 的 FP8 量化版本 LLaDA2.0-Uni-FP8,对 MoE 路由专家权重(gate_proj、up_proj、down_proj)做 128×128 块级 FP8(float8_e4m3fn)量化,模型加载显存从 62.9 GB 降至 32.5 GB,减少约 48%,输出质量保持不变。

来源:inclusionAI Hugging Face models · huggingface.co