腾讯混元与新南威尔士大学提出 E-GRM:奖励模型按需分配算力的动态路由机制 | ACL 2026
大模型推理也能“智能调度”:让奖励模型按需分配算力的动态路由机制 | ACL 2026
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
腾讯混元与新南威尔士大学联合提出 E-GRM 框架,将模型不确定性作为算力调度信号,仅对困难样本投入完整 CoT 推理。在 MATH 数据集上,58% 样本走短路径,延迟从 3.8 秒降至 2.2 秒(-62%),FLOPs 从 23.7T 降至 15.7T(-49%),准确率从 75.1% 提升至 78.4%。
来源:AI前线 · 微信公众号 · mp.weixin.qq.com