上海AI实验室等提出TRM思考奖励模型,给大模型推理过程打分 | ICML'26 Oral
TRM思考奖励模型上线,大模型推理质量终于能量化了 | ICML‘26 Oral
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
上海人工智能实验室、上海交通大学、香港中文大学团队提出TRM(Thinking Reward Model),用ME² principle和DAG-based pairwise evaluation给大模型推理过程打分,把"想得好"变成可训练的奖励信号。
来源:量子位 · 微信公众号 · mp.weixin.qq.com