跳到正文
量子位 · 微信公众号·· 2026-07-24AI 评分42

腾讯混元 E-GRM 让模型学会“自我怀疑”:拿不准才多想,入选 ACL 2026

告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

腾讯混元团队联合 UNSW 提出生成式奖励模型 E-GRM,用模型自身多次采样的答案一致性判断输入复杂度,收敛则直答、不收敛才触发 CoT。在 RM-Bench、RMB、RewardBench 三个基准上,约 58% 样本被路由到直答,延迟降低 62%,准确率还有提升。该工作入选 ACL 2026。

来源:量子位 · 微信公众号 · mp.weixin.qq.com