Dwarkesh Patel· Dwarkesh Patel·· 24 天前AI 评分59
Dwarkesh 实验分析:2019-2025 预训练进展主要来自数据改进
Pretraining progress is mostly coming from data
AI 导读
Dwarkesh Patel 发布研究,在最高 1e19 FLOPs 规模下组合 2019-2025 各年度代表模型配方与公开数据语料训练,发现数据改进带来 12.0x 计算效率增益、模型改进为 3.7x,数据贡献约为模型的 3.24 倍。两者收益基本独立,88% 的 OLMES 分数方差可由模型与数据的加性效应解释;作者提醒小模型更受益于数据精选,而大模型的关键作用在于让大规模计算可用。
来源:Dwarkesh Patel · dwarkesh.com