跳到正文
Hugging Face Daily Papers·· 4 天前AI 评分39

MetaRubric:面向评分标准强化学习的奖励学习

MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

MetaRubric 通过交替进行证据感知的策略优化与响应引导的评分标准自适应,解决评分标准强化学习中的"空洞得分"问题——即评分模型在响应缺少所需信息时仍给出高分。该方法在多个基座模型上将 PubMedQA 准确率较静态评判 GRPO 提升 6.00–20.40 个百分点,并在 HealthBench-Hard 及两个多模态医学基准上取得进一步增益。

来源:Hugging Face Daily Papers · arxiv.org