跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

当前仅显示精选新闻

最新精选

第 81–87 条 · 共 87 条
5月16日周六
  1. Dwarkesh Patel66

    Eric Jang 讲解如何从零构建 AlphaGo

    Eric Jang 在 Dwarkesh Patel 的播客中讲解了如何从零构建 AlphaGo,涵盖蒙特卡洛树搜索、价值网络与策略网络以及自我对弈训练。他对比了 AlphaGo 的 MCTS 与 LLM 的 RL,指出后者需在超长轨迹中解决信用分配问题,而前者每步可给出更优动作作为训练目标。

    推荐理由:从零构建 AlphaGo 的完整讲解,梳理搜索、自我对弈与价值函数如何协同,并延伸到 LLM 的 RL 与自动化研究边界。

5月15日周五
  1. @berryxia66

    Prime Intellect 让 Claude Code(Opus 4.7)和 Codex(GPT 5.5)在 nanoGPT speedrun 的 optimizer track 上完全自主运行,使用闲置算力完成约 1 万次实验、共约 1.4 万 H200 小时,Claude Code 把记录推进到 2930 steps,低于人类基准 2990 steps。

    引用Prime Intellect (@PrimeIntellect)@PrimeIntellect

    Automating AI research is the next major step in AI We let Claude Code (Opus 4.7) and Codex (GPT 5.5) run autonomously on the nanoGPT speedrun optimizer track using our idle compute. ~10k runs, ~14k H200 hours Opus now holds the record at 2930 steps vs the 2990 human baseline

    推荐理由:Prime Intellect 用闲置算力让智能体自主优化 nanoGPT 训练,显示其擅长组合已有方法但在创新上受限,实验日志已开源。

5月9日周六
  1. Hugging Face Blog65

    AI2 发布 EMO:预训练混合专家实现涌现模块化

    AI2 发布 EMO,一个 1B 激活、14B 总参数(8 专家激活、128 专家总量)的混合专家模型,在 1 万亿 token 上端到端预训练,让模块化结构直接从数据中涌现。保留 25% 专家时各基准平均性能只下降约 1%,仅保留 12.5% 专家时平均下降约 3%,而同等架构的标准 MoE 在相同子集设置下明显退化。团队同时开源了 EMO 模型、同等数据的标准 MoE 基线和训练代码。

    推荐理由:EMO 让专家子集按语义领域自然分组,只保留 12.5% 专家仍接近全模型性能,为稀疏 MoE 的部署取舍提供参考。

4月29日周三
4月28日周二
4月20日周一