跳到正文
原文
Hugging Face Daily Papers·· 6 天前AI 评分40

BiasReducer:面向奖励模型的自适应偏见缓解框架

BiasReducer: Adaptive Bias Mitigation for Reward Models

AI 导读

BiasReducer 通过只编辑奖励模型的线性奖励头,自动识别并削弱模型对长度、自信度等表层属性的依赖,无需重新训练。在五个奖励模型上,BiasReducer-M 将三项基准平均提升 8.3、18.0 和 6.9 个百分点,优于两个基于训练的基线。该增益可迁移至下游,减少冗余冗长与谄媚,同时保持相当的评判质量。

来源:Hugging Face Daily Papers · arxiv.org