跳到正文
原文
机器之心· 机器之心·· 20 小时前AI 评分49

亚马逊与杜克大学研究:大模型后训练中万分之一稀疏监督即可提升推理能力

万分之一——大模型后训练中的极端稀疏监督

AI 导读

亚马逊与杜克大学研究发现,在大模型后训练中仅随机保留每条 rollout 中一个 token 的梯度信号(约 0.025%),学生模型推理能力仍显著提升。基于 Qwen3 系列的 9 组教师—学生配置中,保留分歧最大的 1-2 个 token 即可匹配甚至超过全信号训练,且万分之一监督仅更新 10% 网络参数。该现象在代码推理、Llama 系列及 PPO 的 RLVR 中同样成立。

来源:机器之心 · mp.weixin.qq.com