跳到正文
量子位 · 微信公众号·· 2026-06-24AI 评分46

上海AI实验室等提出TRM思考奖励模型,给大模型推理过程打分 | ICML'26 Oral

TRM思考奖励模型上线,大模型推理质量终于能量化了 | ICML‘26 Oral

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

上海人工智能实验室、上海交通大学、香港中文大学团队提出TRM(Thinking Reward Model),用ME² principle和DAG-based pairwise evaluation给大模型推理过程打分,把"想得好"变成可训练的奖励信号。

来源:量子位 · 微信公众号 · mp.weixin.qq.com