跳到正文
Qwen Blog· QwenTeam·· 2025-12-05AI 评分30

千问提出 SAPO:一种稳定高效的大语言模型强化学习方法

SAPO: A Stable and Performant Reinforcement Learning Method for Training Large Language Models

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

千问(Qwen)提出 SAPO,一种用于训练大语言模型的稳定且高性能的强化学习方法。该方法针对实践中基于组的策略优化——即每个提示词采样多个回答并在组内归一化奖励——进行改进。

来源:Qwen Blog · qwen.ai