跳到正文
AI科技评论 · 微信公众号·· 2026-07-09AI 评分49

哈佛大学 Sham Kakade ICML 2026 演讲:二次模型为何能预测 LLM 预训练动态

哈佛大学 Sham Kakade 硬核万字演讲:LLM 预训练,二次模型该站 C 位| ICML 2026

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

哈佛大学教授 Sham Kakade 在 ICML 2026 演讲中论证,一个简单二次模型即可精准预测 LLM 动态预训练中的大部分优化效果。他通过对真实大规模神经网络不同 checkpoint 做泰勒展开构建二次模型,发现关键窗口内损失轨迹与真实网络近乎完全重合,高阶项几乎无贡献。该框架可推导任意时间学习最优策略、临界批量大小与动态最优学习率,并揭示动量的作用边界。

来源:AI科技评论 · 微信公众号 · mp.weixin.qq.com