跳到正文
AI科技评论 · 微信公众号·· 2026-08-14AI 评分46

清华与腾讯混元发布 LPO:补齐 DeepSeek-R1 后推理模型的多样性短板

Pass@k 15/15 组全胜!清华&腾讯发布 LPO,补齐 DeepSeek-R1 推理多样性的「短板」 | GAIR Paper 122

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

清华大学自动化系与腾讯混元提出 Listwise Policy Optimization(LPO),把 group-based RLVR 显式建模为 LLM Response Simplex 上的目标投影,并拆分为目标分布与投影方式两步。

来源:AI科技评论 · 微信公众号 · mp.weixin.qq.com