inclusionAI 发布 Ling-3.0-flash 的 DSpark 推测解码草稿模型
inclusionAI/Ling-3.0-flash-dspark
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
inclusionAI 发布 Ling-3.0-flash 的 DSpark 推测解码草稿模型,1.36B 参数、BF16 精度、5 层全注意力,用 SpecForge 训练并支持 SGLang 与 llama.cpp 部署。该草稿模型采用 8 个 draft token 的块大小(验证宽度 9),在 GSM8K、HumanEval 等九项负载上的接受长度宏均为 5.29。
来源:inclusionAI Hugging Face models · huggingface.co