DACA-GRPO:面向扩散语言模型强化学习的去噪感知信用分配
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
针对扩散语言模型强化学习中将所有去噪步骤等同对待、依赖有偏高方差似然估计的问题,研究者提出 DACA-GRPO,一种可插拔的 GRPO 训练器增强方法,通过去噪感知的信用分配解决去噪轨迹上的时序信用分配缺失与平均场似然估计偏差两大缺陷。
来源:Apple Machine Learning Research · machinelearning.apple.com