跳到正文
@vista8· @vista8 · X·· 2026-06-03AI 评分44
AI 导读

斯坦福团队发现,计算量足够大时,用未过滤的Common Crawl数据训练大模型效果反而优于清洗数据。15M小模型上过滤数据全面领先,但模型规模达330M和1B时情况反转,未过滤数据在充分训练后超越所有过滤版本。研究者认为模型参数空间足够大时,能将噪声与有用信息隔离开。

正文

今天读到斯坦福大学研究团队的一个论文,有点跟直觉不一样。

把没过滤的Common Crawl数据喂给大模型,发现计算量足够大时,不过滤数据效果反而比清洗后的数据效果好。

在 15M 小模型上,过滤数据全面领先,未过滤的很差。

但当模型规模达到 330M 和 1B 时,情况完全反转,未过滤的在充分训练后超越了所有过滤版本。

小模型怕垃圾,大模型不怕。

模型大,秩(参数量)多,就有足够空间把垃圾和有用信息隔离开。

论文解读和原始PDF见评论区

来源:@vista8 · x.com