Hugging Face Daily Papers·· 3 天前AI 评分33
CorrGRPO:面向多奖励学习的相关性归一化 GRPO
CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning
AI 导读
CorrGRPO 提出将 GRPO 中成对奖励协方差归一化为皮尔逊相关系数,在不改变中心化总奖励的前提下,平衡不同尺度奖励对归一化的影响,避免大尺度奖励主导优势值计算。研究者在代码生成、工具调用和智能体安全三类任务上,使用 0.5B 至 8B 参数的模型进行对比,结果显示 CorrGRPO 在三项任务上均优于 GRPO 及其他变体。代码已开源。
来源:Hugging Face Daily Papers · arxiv.org