Qwen团队等提出Confident Decoding,绕开对齐税使奥数难题准确率提升22.4%
大模型最后一层竟是推理累赘?绕开对齐税,奥数准确率暴涨 22.4%!
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Qwen团队、清华大学与南洋理工大学的研究指出,大模型最末几层会因RLHF、DPO等对齐后训练产生对齐税扰动,中间层反而凝聚了更精准的推理语义,并提出免训练、即插即用的解码策略Confident Decoding。
来源:量子位 · 微信公众号 · mp.weixin.qq.com