千问提出 SAPO:一种稳定高效的大语言模型强化学习方法
SAPO: A Stable and Performant Reinforcement Learning Method for Training Large Language Models
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
千问(Qwen)提出 SAPO,一种用于训练大语言模型的稳定且高性能的强化学习方法。该方法针对实践中基于组的策略优化——即每个提示词采样多个回答并在组内归一化奖励——进行改进。
来源:Qwen Blog · qwen.ai