跳到正文

Dwarkesh Patel

dwarkesh.com · 网站与博客

当前显示全部 AI 相关新闻
切换来源
27 条AI 相关新闻 · 最新在前
10月1日周四
  1. Dwarkesh Patel46

    Si Sheppard 谈几百名西班牙士兵如何推翻阿兹特克与印加两大帝国

    军事历史学家 Si Sheppard 在播客中讲述 Cortés 与 Pizarro 如何以数百名征服者推翻阿兹特克和印加帝国:Cortés 在两年半内征服 600 万人口的阿兹特克,Pizarro 十年后征服约 1000 万人口的印加。征服者常在 100 倍甚至 1000 倍兵力劣势下取胜,且多达 99% 的兵力由被征服的原住民组成。

9月17日周四
9月12日周六
  1. Dwarkesh Patel56

    Dwarkesh 对谈 John Schulman、Beren Millidge 与 Charlie O'Neill:递归自我改进还有多远

    Dwarkesh Patel 与 Zyphra CTO Beren Millidge、Thinking Machines 首席科学家 John Schulman、Baseten 模型训练负责人 Charlie O'Neill 长篇对谈,逐段讨论递归自我改进(RSI)最可能失败的技术原因、中国实验室的追赶路径、自动化 AI 研究者的训练方式以及长时程 RL 能否带来 AGI。

9月9日周三
  1. Dwarkesh Patel59

    Dwarkesh 实验分析:2019-2025 预训练进展主要来自数据改进

    Dwarkesh Patel 发布研究,在最高 1e19 FLOPs 规模下组合 2019-2025 各年度代表模型配方与公开数据语料训练,发现数据改进带来 12.0x 计算效率增益、模型改进为 3.7x,数据贡献约为模型的 3.24 倍。两者收益基本独立,88% 的 OLMES 分数方差可由模型与数据的加性效应解释;作者提醒小模型更受益于数据精选,而大模型的关键作用在于让大规模计算可用。

9月1日周二
8月30日周日
8月25日周二
8月12日周三
8月8日周六
  1. Dwarkesh Patel58

    Dwarkesh Patel 提出持续学习时代的 8 项 AI 预测

    Dwarkesh Patel 提出持续学习到来后的 8 项预测,认为模型仅在会话间写 Markdown 无法积累执行整份工作所需的经验,经验必须沉淀进权重。他据此推论部署前安全检查将失效、对齐技术需重构、领先实验室将靠部署数据加速拉开差距,并以 Anthropic 内部自 2 月起使用 Mythos、6 月才公开发布的 4 个月差距为例说明先发部署的学习优势。

8月4日周二
7月29日周三
7月11日周六
7月2日周四
6月30日周二
  1. Dwarkesh Patel45

    Grant Sanderson 谈 AI 与数学的未来

    3Blue1Brown 的 Grant Sanderson 在播客中讨论 AI 在数学领域的进展。他指出 AI 自 2024 年起能在 19 秒内解出 IMO 几何题,但在组合数学题上仍表现吃力,数学内部的进展呈现"分形"式的不均衡。他还探讨了 AI 能否找到领域间隐藏联系、概念性突破的验证周期可能长达一个世纪,以及 AI 是否净增人类对数学的理解。

6月26日周五
6月20日周六
  1. Dwarkesh Patel59

    Dwarkesh:AI 进步的核心是数据黑洞而非样本效率提升

    Dwarkesh Patel 撰文认为,近几年 AI 进步主要来自更宽更好的数据分布和 RL 合成数据,而非样本效率提升。他估算人类从出生到成年只接触约 2 亿 token,前沿模型却训练于数十至数百万亿 token,差距近百万倍;按 Chinchilla 常数,即使无限增加参数也只能将所需数据降低约 10 倍,说明人类处于不同的 scaling 曲线。

6月5日周五
5月22日周五
5月17日周日
  1. Dwarkesh Patel44

    混淆智能与权力:为什么 AI 变强不等于 AI 掌权

    Dwarkesh Patel 撰文指出,将智能定义为"跨领域实现目标的能力"实际上是把智能等同于权力,而现实中极端权力与科学/技术意义上的智能相关性很弱——物理学家并未统治世界。他认为 AI 正通过编程等具体经济任务变强,这与权力获取的相关性并不强;更可能的图景是自动化企业在正常资本主义竞争中胜出,而非单个 AI 智胜所有人。

  2. Dwarkesh Patel39

    预训练并行策略与训练失败原因笔记

    预训练失败的两大主因是破坏因果性和引入偏差:专家路由中的 expert choice 与 token dropping 会让训练看到部署时不存在的信息,据传这解释了 Llama 4 表现不佳,Gemini 2 Pro 也曾受 token dropping 困扰。GPT-4 早期训练因在 all-reduce 等集合通信中使用 FP16,累加小梯度时数值精度丢失导致结果偏差达 10 倍。

5月16日周六
  1. Dwarkesh Patel66

    Eric Jang 讲解如何从零构建 AlphaGo

    Eric Jang 在 Dwarkesh Patel 的播客中讲解了如何从零构建 AlphaGo,涵盖蒙特卡洛树搜索、价值网络与策略网络以及自我对弈训练。他对比了 AlphaGo 的 MCTS 与 LLM 的 RL,指出后者需在超长轨迹中解决信用分配问题,而前者每步可给出更优动作作为训练目标。

    推荐理由:从零构建 AlphaGo 的完整讲解,梳理搜索、自我对弈与价值函数如何协同,并延伸到 LLM 的 RL 与自动化研究边界。

5月9日周六
4月30日周四
4月27日周一
4月25日周六