跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

当前仅显示精选新闻
102条精选相关主题论文研究部署工程模型发布

最新精选

第 101–102 条 · 共 102 条
10月27日周一
  1. Thinking Machines Lab Blog67

    Thinking Machines Lab 提出在线策略蒸馏方法,用更少算力复现 RL 后训练效果

    Thinking Machines Lab 发布关于在线策略蒸馏(On-Policy Distillation)的研究:从学生模型采样轨迹,由教师模型逐 token 计算反向 KL 作为密集奖励,结合 RL 的在线策略相关性与蒸馏的密集信号。

    推荐理由:Thinking Machines 亲自实验并给出复现代码,读者可以据此评估这种训练方法在自己场景下的成本收益。

9月29日周一
  1. Thinking Machines Lab Blog66

    Thinking Machines Lab 发表 LoRA Without Regret:LoRA 在多数后训练场景可追平全量微调

    Thinking Machines Lab 发布 John Schulman 署名的研究,发现在满足两个条件时 LoRA 的样本效率与最终性能与全量微调相当:一是应用于全部权重层尤其是 MLP/MoE 层,二是不受容量限制即数据集规模不超过 LoRA 参数容量。

    推荐理由:原文系统实验给出 LoRA 追平全量微调的两个条件和最优学习率为其 10 倍等可操作结论,可直接指导微调选型。