MetaRubric:面向评分标准强化学习的奖励学习
MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
MetaRubric 通过交替进行证据感知的策略优化与响应引导的评分标准自适应,解决评分标准强化学习中的"空洞得分"问题——即评分模型在响应缺少所需信息时仍给出高分。该方法在多个基座模型上将 PubMedQA 准确率较静态评判 GRPO 提升 6.00–20.40 个百分点,并在 HealthBench-Hard 及两个多模态医学基准上取得进一步增益。
来源:Hugging Face Daily Papers · arxiv.org