跳到正文
Apple Machine Learning Research·· 2026-08-27AI 评分28

Apple 提出基于评分标准的对齐框架,用于开放域知识问答

From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

Apple 提出基于评分标准(rubric)的奖励框架,针对开放域问答生成以检索证据为依据、按多个质量维度拆分的查询专属评分标准,在后期训练中提供细粒度监督。该方法在 composition、grounding 和 instruction-following 三个评测维度上的平均表现优于基线。

来源:Apple Machine Learning Research · machinelearning.apple.com