Hugging Face Daily Papers·· 2 天前AI 评分36
DARA:面向多奖励强化学习的密度感知奖励聚合方法
Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL
AI 导读
针对多奖励强化学习中各目标学习进度不均的问题,研究者提出密度感知奖励聚合方法 DARA,通过逆平方根密度校正,为激活频率较低的奖励信号赋予更高权重。在工具调用任务上,DARA 最多减少 26% 训练步数达到高格式合规率;在数学推理任务上,最多减少 65% 步数接近长度合规饱和,最终性能与 GDPO 相当。
来源:Hugging Face Daily Papers · arxiv.org