Together AI 提出 CDLM:扩散语言模型推理最高提速 14 倍且不牺牲质量
Consistency diffusion language models: Up to 14x faster inference without sacrificing quality
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Together AI 提出一致性扩散语言模型 CDLM,通过轨迹蒸馏、块级因果注意力掩码与三项联合训练目标,让扩散语言模型在减少采样步数的同时支持精确的块级 KV 缓存。在 Dream-7B-Instruct 上,CDLM 将精炼步数减少约 4.1x–7.7x,GSM8K-CoT 延迟最高降低 11.2x,MBPP-Instruct 最高降低 14.5x,多数任务准确率变化很小。
来源:Together AI Blog · together.ai