LittleLearner:在教学控制的知识暴露下训练语言模型
LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者发布 LITTLECURRICULUM——一个 88B token 的预训练语料,仅覆盖美国小学教材内容,明确排除五年级以上才教授的概念、事实与词汇。基于该语料从零训练的 5B 参数模型 LITTLELEARNER 具备开放式评测所需的语言能力,同时拥有与可解释课程大纲对应的清晰知识与能力边界。
来源:Hugging Face Daily Papers · arxiv.org