跳到正文
Hugging Face Daily Papers·· 2 天前AI 评分34

APO:数据稀缺下 LLM 个性化偏好对齐的协作初始化方法

Collaborative Personalized Preference Alignment for LLMs under Data Deficiency

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

针对用户反馈稀缺导致 LLM 个性化对齐困难的问题,研究者提出 Approximate Pareto Optimality(APO),通过将更新兼容的用户分组、结合梯度下降与受控上升协调冲突目标,协作学习对齐器初始化。在 Fed-ChatbotPA 和 UltraFeedback 上,仅用 20 个本地样本即持续优于现有方法。

来源:Hugging Face Daily Papers · arxiv.org