跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分46

合成预预训练在规模扩展下依然有效,但并非语法先验

Synthetic Pre-pretraining Survives Scale, but Not as a Grammatical Prior

AI 导读

一项覆盖 500M 至 7B 参数、PT 预算最高 100B token 的研究显示,合成数据预预训练(PPT)的 token 效率增益在规模扩展后依然存在,3B 规模下可节省至少 21B PT token。但研究未发现一致证据表明这些增益来自语法先验,下游表现与语法可接受性在各模型规模上并不一致。增益实际来自提升长程检索能力的 PPT 任务,且对 PT 数据混合方式稳健,仅在缺少网页文本时减弱。

来源:Hugging Face Daily Papers · arxiv.org