跳到正文
量子位 · 微信公众号·· 23 天前AI 评分41

中科大与阿里提出 PARPO 个性化智能体强化学习框架,8B 模型盲测第一

个性化智能体强化学习框架上线,8B模型盲测第一

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

中国科学技术大学与阿里巴巴团队提出 PARPO 个性化智能体强化学习框架,将用户偏好引入 Agentic RL 训练目标,由 PSGM 技能记忆、两阶段偏好解耦奖励模型和 PARPO 优化器三部分组成。

来源:量子位 · 微信公众号 · mp.weixin.qq.com