哈佛大学 Sham Kakade ICML 2026 演讲:二次模型为何能预测 LLM 预训练动态
哈佛大学 Sham Kakade 硬核万字演讲:LLM 预训练,二次模型该站 C 位| ICML 2026
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
哈佛大学教授 Sham Kakade 在 ICML 2026 演讲中论证,一个简单二次模型即可精准预测 LLM 动态预训练中的大部分优化效果。他通过对真实大规模神经网络不同 checkpoint 做泰勒展开构建二次模型,发现关键窗口内损失轨迹与真实网络近乎完全重合,高阶项几乎无贡献。该框架可推导任意时间学习最优策略、临界批量大小与动态最优学习率,并揭示动量的作用边界。
来源:AI科技评论 · 微信公众号 · mp.weixin.qq.com