超越下一 token 预测:扩散语言模型与自回归语言模型的性能对比
Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究对比了扩散语言模型(DLM)与自回归语言模型(ARM)的性能表现。ARM 逐 token 顺序生成,在下游任务上准确率高,但因下一 token 预测的固有顺序依赖导致算术强度偏低;DLM 则作为新兴范式展现出潜力。
来源:Apple Machine Learning Research · machinelearning.apple.com