Eric Jang 讲解如何从零构建 AlphaGo
Eric Jang 在 Dwarkesh Patel 的播客中讲解了如何从零构建 AlphaGo,涵盖蒙特卡洛树搜索、价值网络与策略网络以及自我对弈训练。他对比了 AlphaGo 的 MCTS 与 LLM 的 RL,指出后者需在超长轨迹中解决信用分配问题,而前者每步可给出更优动作作为训练目标。
推荐理由:从零构建 AlphaGo 的完整讲解,梳理搜索、自我对弈与价值函数如何协同,并延伸到 LLM 的 RL 与自动化研究边界。
训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。
当前仅显示精选新闻Eric Jang 在 Dwarkesh Patel 的播客中讲解了如何从零构建 AlphaGo,涵盖蒙特卡洛树搜索、价值网络与策略网络以及自我对弈训练。他对比了 AlphaGo 的 MCTS 与 LLM 的 RL,指出后者需在超长轨迹中解决信用分配问题,而前者每步可给出更优动作作为训练目标。
推荐理由:从零构建 AlphaGo 的完整讲解,梳理搜索、自我对弈与价值函数如何协同,并延伸到 LLM 的 RL 与自动化研究边界。
Automating AI research is the next major step in AI We let Claude Code (Opus 4.7) and Codex (GPT 5.5) run autonomously on the nanoGPT speedrun optimizer track using our idle compute. ~10k runs, ~14k H200 hours Opus now holds the record at 2930 steps vs the 2990 human baseline
推荐理由:Prime Intellect 用闲置算力让智能体自主优化 nanoGPT 训练,显示其擅长组合已有方法但在创新上受限,实验日志已开源。
AI2 发布 EMO,一个 1B 激活、14B 总参数(8 专家激活、128 专家总量)的混合专家模型,在 1 万亿 token 上端到端预训练,让模块化结构直接从数据中涌现。保留 25% 专家时各基准平均性能只下降约 1%,仅保留 12.5% 专家时平均下降约 3%,而同等架构的标准 MoE 在相同子集设置下明显退化。团队同时开源了 EMO 模型、同等数据的标准 MoE 基线和训练代码。
推荐理由:EMO 让专家子集按语义领域自然分组,只保留 12.5% 专家仍接近全模型性能,为稀疏 MoE 的部署取舍提供参考。
IBM Granite 团队发布技术解读,说明 Granite 4.1 系列 3B、8B、30B 稠密模型基于约 15T token 的五阶段预训练流程构建,上下文窗口经长上下文扩展至 512K。
推荐理由:原文完整披露 Granite 4.1 的五阶段预训练数据配比与多阶段 RL 流程,可供同类小模型训练参考。
NVIDIA 发布开源全能多模态理解模型 Nemotron 3 Nano Omni 30B-A3B,在 OCRBenchV2-En 得分 65.8、MMLongBench-Doc 57.5,并新增音频与视频理解能力。
推荐理由:原文列出文档、视频与音频榜单成绩及吞吐对比,读者可据此判断该开源全能模型的能力边界。
inclusionAI 发布 4B 深度研究智能体 DR-Venus-4B-SFT,基于 Qwen3-4B-Thinking-2507 在清洗后的开源 REDSearcher 轨迹上做智能体监督微调,最大训练长度 200K,使用 search 与 visit 工具。
推荐理由:给出 9B 以下开源深研究智能体的基准对比,读者可据此判断 4B 模型的深研究能力位置。
Anthropic 与 Amazon 签署新协议,将获得最高 5 吉瓦(GW)用于训练和部署 Claude 的算力,并在未来十年向 AWS 技术投入超过 1000 亿美元。
推荐理由:协议披露了算力规模、芯片代际与投资金额,可据此判断 Claude 训练与推理基础设施的扩张节奏。