清华与腾讯混元发布 LPO:补齐 DeepSeek-R1 后推理模型的多样性短板
Pass@k 15/15 组全胜!清华&腾讯发布 LPO,补齐 DeepSeek-R1 推理多样性的「短板」 | GAIR Paper 122
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
清华大学自动化系与腾讯混元提出 Listwise Policy Optimization(LPO),把 group-based RLVR 显式建模为 LLM Response Simplex 上的目标投影,并拆分为目标分布与投影方式两步。
来源:AI科技评论 · 微信公众号 · mp.weixin.qq.com