跳到正文
Hugging Face Daily Papers·· 2026-09-04AI 评分41

小语言模型作为评分标准强化学习的评判者

Small Language Models as Judges for Rubric-Based Reinforcement Learning

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究用 Qwen3-1.7B 等小模型替代 7B 以上大模型做评分标准(rubric)评判,构建了 PointRubric 和 RaR-Science-Static 两个逐点评测数据集,比较生成式判定、Yes/No Logprob 边际和 Probe 评判三种方式。

来源:Hugging Face Daily Papers · arxiv.org