小语言模型作为评分标准强化学习的评判者
Small Language Models as Judges for Rubric-Based Reinforcement Learning
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究用 Qwen3-1.7B 等小模型替代 7B 以上大模型做评分标准(rubric)评判,构建了 PointRubric 和 RaR-Science-Static 两个逐点评测数据集,比较生成式判定、Yes/No Logprob 边际和 Probe 评判三种方式。
来源:Hugging Face Daily Papers · arxiv.org