LLM 预训练中的领域数据重复扩展研究
Scaling Domain Data Repetition in LLM Pretraining
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究发现,在固定 tokens-per-parameter(TPP)比例下,领域数据的最优重复次数随模型规模增大而轻微上升;不同领域中,最优重复次数与该领域最终验证损失呈强负相关,验证损失越低的领域越能从更多重复中获益,而唯一领域数据量与最优重复次数的关系较弱。这表明用相同 TPP 的小型代理模型调出的重复次数,可为更大模型提供实用估计。
来源:Hugging Face Daily Papers · arxiv.org