跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分36

DARA:面向多奖励强化学习的密度感知奖励聚合方法

Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL

AI 导读

针对多奖励强化学习中各目标学习进度不均的问题,研究者提出密度感知奖励聚合方法 DARA,通过逆平方根密度校正,为激活频率较低的奖励信号赋予更高权重。在工具调用任务上,DARA 最多减少 26% 训练步数达到高格式合规率;在数学推理任务上,最多减少 65% 步数接近长度合规饱和,最终性能与 GDPO 相当。

来源:Hugging Face Daily Papers · arxiv.org