跳到正文
Hugging Face Daily Papers·· 6 天前AI 评分33

LexReward:面向法律语言模型的分类驱动奖励框架

LexReward: A Taxonomy-Driven Reward Framework for Legal Language Models

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

LexReward 是一个面向法律语言模型的分类驱动奖励框架,从 Style、Element、Chain 三个维度刻画法律回答质量,并为每个维度制定评分细则。基于该奖励构建的偏好数据用于 DPO 训练,在三个维度上均提升表现;训练出的奖励模型 LexRM 通过强化学习分别改善对应维度的策略表现,且奖励阶段无需参考答案。

来源:Hugging Face Daily Papers · arxiv.org