跳到正文
@dongxi_nlp· @dongxi_nlp · X·· 29 天前AI 评分29
AI 导读

作者与Claude Code合作训练了一个MoE模型,每个token实际仅激活约365万参数,训练只用一颗Intel Xeon CPU的单个核心。作者认为训练阶段可以接受高资源消耗,因为训练只发生一次,而模型后续可能被调用数十亿次。由此引出问题:若目标是极低推理成本,究竟该给一个极小模型喂多少数据?

正文

通过与 Claude code 的合作,作者训练的 MoE 模型每个 token 实际只激活约 365 万参数,而且训练仅使用一颗 Intel Xeon CPU 的单个核心。

我们完全可以接受训练阶段花很多资源,因为训练只发生一次,随后模型可能被调用数十亿次。

所以问题来了,如果目标是极低推理成本,我们究竟应该给一个极小模型喂多少数据?

来源:@dongxi_nlp · x.com