分层语言模型的多字节预测(MBP):并行生成多字节加速推理
Dynamic Multi-Byte Prediction With Hierarchical Language Models
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
分层语言模型提出多字节预测(MBP),可并行生成多个字节,在不增加参数、性能影响极小的前提下加速推理。MBP 基于多 token 预测(MTP)范式,引入与分层 LM 潜在 token(segment)对齐的可变长度预测窗口,以及不破坏因果性的注意力掩码方案。在指令跟随、问答、摘要和机器翻译等任务上,MBP 实现了性能与推理吞吐之间的帕累托最优权衡。
来源:Hugging Face Daily Papers · arxiv.org