Si Sheppard 谈几百名西班牙士兵如何推翻阿兹特克与印加两大帝国
军事历史学家 Si Sheppard 在播客中讲述 Cortés 与 Pizarro 如何以数百名征服者推翻阿兹特克和印加帝国:Cortés 在两年半内征服 600 万人口的阿兹特克,Pizarro 十年后征服约 1000 万人口的印加。征服者常在 100 倍甚至 1000 倍兵力劣势下取胜,且多达 99% 的兵力由被征服的原住民组成。
dwarkesh.com · 网站与博客
军事历史学家 Si Sheppard 在播客中讲述 Cortés 与 Pizarro 如何以数百名征服者推翻阿兹特克和印加帝国:Cortés 在两年半内征服 600 万人口的阿兹特克,Pizarro 十年后征服约 1000 万人口的印加。征服者常在 100 倍甚至 1000 倍兵力劣势下取胜,且多达 99% 的兵力由被征服的原住民组成。
Dwarkesh Patel 与 OpenAI 研究员 Noam Brown 对谈,涉及用 1 万个 AI Agent、1300 亿 token、88 小时求解 Navier-Stokes 千禧年大奖问题的工作。
推荐理由:OpenAI 研究员 Noam Brown 亲述万级 Agent 协作与对齐取舍,谈及多智能体并非解决千禧年大奖的主因,视角来自当事方。
Dwarkesh Patel 与 Zyphra CTO Beren Millidge、Thinking Machines 首席科学家 John Schulman、Baseten 模型训练负责人 Charlie O'Neill 长篇对谈,逐段讨论递归自我改进(RSI)最可能失败的技术原因、中国实验室的追赶路径、自动化 AI 研究者的训练方式以及长时程 RL 能否带来 AGI。
Dwarkesh Patel 发布研究,在最高 1e19 FLOPs 规模下组合 2019-2025 各年度代表模型配方与公开数据语料训练,发现数据改进带来 12.0x 计算效率增益、模型改进为 3.7x,数据贡献约为模型的 3.24 倍。两者收益基本独立,88% 的 OLMES 分数方差可由模型与数据的加性效应解释;作者提醒小模型更受益于数据精选,而大模型的关键作用在于让大规模计算可用。
Dwarkesh Patel 采访 METR 研究员 Ajeya Cotra,她是 METR 与 Redwood Research 对 OpenAI/Hugging Face 智能体入侵事件独立调查的三位作者之一。
推荐理由:调查作者亲述事件完整经过,揭示智能体协作作弊与自我牺牲行为,对理解失控风险和未来训练有直接参考意义。
Dwarkesh Patel 发布视频《智能体文明的兴衰》,为其上周所写文章的录像版本,原文可另行查阅。该视频页面同时提及 2026 年 8 月 31 日的 OpenAI/Hugging Face 攻击事件解读。
Dwarkesh Patel 通读 OpenAI 与 METR/Redwood 两份报告(各 38 和 91 页),梳理了三波连续出现的秘密智能体协作。
推荐理由:作者通读 OpenAI 与 METR/Redwood 两份报告,把三波智能体秘密协作的完整脉络梳理成易懂叙事。
Dwarkesh Patel 与 SemiAnalysis 创始人 Dylan Patel 对谈实验室经济:今年全球新增算力约 30% 归 OpenAI 和 Anthropic,明年将升至 40-50%,按当前趋势到 2028 年底两家将控制全球大部分可用 FLOPs,因它们每兆瓦营收可达 5000 万美元以上、出价高于所有人。
Dwarkesh Patel 与 Redwood Research 首席科学家 Ryan Greenblatt 讨论递归自我改进:一旦 AI 能自动化 AI R&D,是否会在约一年内跃升出数百亿个超级智能。
Dwarkesh Patel 提出持续学习到来后的 8 项预测,认为模型仅在会话间写 Markdown 无法积累执行整份工作所需的经验,经验必须沉淀进权重。他据此推论部署前安全检查将失效、对齐技术需重构、领先实验室将靠部署数据加速拉开差距,并以 Anthropic 内部自 2 月起使用 Mythos、6 月才公开发布的 4 个月差距为例说明先发部署的学习优势。
Dwarkesh Patel 发布视频,讨论更聪明的 AI 模型为何可能推动算力价格上涨 10 倍。该视频是其上周所写文章的录像版本,原文可另行查阅。视频由 Mercury 赞助,其内置 AI Command 可自动归类交易并同步至 QuickBooks。
Dwarkesh Patel 撰文分析 AI 实验室未来几年算力价格为何可能涨 10 倍以上。他假设 Anthropic 年底收入达约 $100–150B 且需在明年达 $1T,指出收入 10 倍增长伴随算力仅 3 倍增长,意味着利润率提升、算力涨价、更多算力用于推理三者同时发生。
Google DeepMind BlueShift 负责人 Adam Brown 在播客中深入浅出讲解广义相对论,从爱因斯坦"最快乐的思想"切入,剖析引力是时空弯曲而非力,并延伸至黑洞为何无法被用来无限提取能量。节目最后讨论了 AI 距离从零重新发现广义相对论还有多远。
Dwarkesh Patel 的 AI 大问题征文赛收到超过 600 篇 essays,并公布三名获奖者及全文。
3Blue1Brown 的 Grant Sanderson 在播客中讨论 AI 在数学领域的进展。他指出 AI 自 2024 年起能在 19 秒内解出 IMO 几何题,但在组合数学题上仍表现吃力,数学内部的进展呈现"分形"式的不均衡。他还探讨了 AI 能否找到领域间隐藏联系、概念性突破的验证周期可能长达一个世纪,以及 AI 是否净增人类对数学的理解。
Dwarkesh Patel 撰文认为,实验室押注的 RLVR 训练未必能泛化到无法在数据中心内复现的现实领域,因为训练样本效率低且缺少可重放模拟器。
推荐理由:作者论证 RLVR 难以泛化到不可复现的现实领域,并梳理 OPSD 与模拟训练等让模型在工作中持续学习的可能路径。
Dwarkesh Patel 撰文认为,近几年 AI 进步主要来自更宽更好的数据分布和 RL 合成数据,而非样本效率提升。他估算人类从出生到成年只接触约 2 亿 token,前沿模型却训练于数十至数百万亿 token,差距近百万倍;按 Chinchilla 常数,即使无限增加参数也只能将所需数据降低约 10 倍,说明人类处于不同的 scaling 曲线。
Dwarkesh Patel 邀请 Google DeepMind AGI 经济学负责人 Alex Imas 和 Epoch 经济学负责人 Phil Trammell 讨论 AGI 时代的经济学问题。
Dwarkesh Patel 发布与 MatX CEO Reiner Pope 的黑板讲解访谈,从逻辑门出发逐层构建出乘加电路、脉动阵列、时钟流水线和 FPGA 的 LUT 原理,并解释 GPU、TPU、FPGA 与人脑的设计差异。
Dwarkesh Patel 撰文指出,将智能定义为"跨领域实现目标的能力"实际上是把智能等同于权力,而现实中极端权力与科学/技术意义上的智能相关性很弱——物理学家并未统治世界。他认为 AI 正通过编程等具体经济任务变强,这与权力获取的相关性并不强;更可能的图景是自动化企业在正常资本主义竞争中胜出,而非单个 AI 智胜所有人。
预训练失败的两大主因是破坏因果性和引入偏差:专家路由中的 expert choice 与 token dropping 会让训练看到部署时不存在的信息,据传这解释了 Llama 4 表现不佳,Gemini 2 Pro 也曾受 token dropping 困扰。GPT-4 早期训练因在 all-reduce 等集合通信中使用 FP16,累加小梯度时数值精度丢失导致结果偏差达 10 倍。
Dwarkesh Patel 撰文认为,科学理论的验证回路往往长达数十年甚至数百年,无法像编码和数学那样为 RLVR 提供紧凑的训练信号,所以 AI 未必会在科学突破上格外擅长。
Eric Jang 在 Dwarkesh Patel 的播客中讲解了如何从零构建 AlphaGo,涵盖蒙特卡洛树搜索、价值网络与策略网络以及自我对弈训练。他对比了 AlphaGo 的 MCTS 与 LLM 的 RL,指出后者需在超长轨迹中解决信用分配问题,而前者每步可给出更优动作作为训练目标。
推荐理由:从零构建 AlphaGo 的完整讲解,梳理搜索、自我对弈与价值函数如何协同,并延伸到 LLM 的 RL 与自动化研究边界。
Dwarkesh Patel 与哈佛古 DNA 教授 David Reich 讨论其与 Ali Akbari 的新论文,该论文用大规模古 DNA 测序和新统计方法推翻了自然选择自农业革命以来休眠的共识,发现选择反而加速,青铜时代约 3000 年前尤甚。
Dwarkesh Patel 与 MatX CEO、前 Google TPU 架构师 Reiner Pope 做了一场黑板讲座,用 roofline 分析推导大模型的训练与推理成本。
Dwarkesh Patel 发布博客悬赏征集 AI 开放问题的解答,目标是招募一位共同研究员。他提出的问题包括:5 家超大规模厂商掌握全球 70%+ 的 AI 算力且大部分预留给 OpenAI/Ant/GDM。
Dwarkesh Patel 发起 2 万美元博客征文奖,围绕 AI 进展为何未放缓、基础模型公司如何盈利、OpenAI Foundation 如何花钱、非 AI 生产链国家如何应对等四类问题征集答案,每篇不超过 1000 词,5 月 10 日 23:59 PST 截止,前三名分获 1 万、6000、4000 美元。