Nathan Lambert 对谈 Epoch AI 的 JS Denain:RSI、中美差距与蒸馏
Interconnects 播客中,Nathan Lambert 与 Epoch AI Insights 负责人 Jean-Stanislas Denain 讨论多项议题。
interconnects.ai · 网站与博客
Interconnects 播客中,Nathan Lambert 与 Epoch AI Insights 负责人 Jean-Stanislas Denain 讨论多项议题。
Nathan Lambert 将其给美国国会的演讲稿整理为 2026 年开源权重模型现状综述,认为中国模型(GLM-5.3、Kimi K3 等)已明确领先美国开源模型,AAII 得分 45/44 对美国最佳 26,开源与闭源前沿差距约 2-5 个月。
推荐理由:作者以自建数据和演讲稿形式梳理中美开源权重模型的差距、采用与风险,读者可获得一份少见的系统性对比视角。
Nathan Lambert 撰文认为真正的递归自我改进(RSI)尚未到来,当前的自动化加速集中在软件工程、日志监控、实验管理等可验证任务,主张以 lossy self-improvement 作为进展基线。
Interconnects 作者 Nathan Lambert 公布一份开放模型研究书单,覆盖开放模型战略、中美竞争、技术细节与蒸馏争议等主题,并承诺持续更新。书单收录 Mark Zuckerberg、Irene Solaiman、SemiAnalysis、Kevin Xu 等人的文章与论文,并指出当前开源与闭源模型的差距约为 4-6 个月,2024 年前后领先的开放模型均来自中国实验室。
Nathan Lambert 在 Interconnects 撰文分析 Jacob Coxon 因安全风险辞职事件为何大范围传播,指出 AI 风险讨论早已因 OpenAI-HuggingFace 事件和 Navier-Stokes 突破而升温,恐惧叙事加上 WSJ 披露的媒体协调使事件如野火般蔓延。
Nathan Lambert 认为 AI 对普通人日常生活的直接触达仍然边缘化,家庭、饮食、交通和娱乐等核心领域几乎感受不到影响,AI 目前主要是服务精英的知识工作工具。他警告若 AI 只带动半个社会,可能重演英国 1790 至 1840 年工资停滞而人均 GDP 快速扩张的"恩格斯停顿",进而拖累 AI 发展。
智谱 GLM-5.3 从 MIT 转为自定义许可证,要求年收入超 100 亿美元的模型服务商通过 Z.AI 安全审查,但许可证未定义"关联方"。本期还收录 Motif-3(MIT 许可)、腾讯 Hy4-preview、Qwen3.8-Flash-Next(125B-A6B)等新模型。
Nathan Lambert 撰文分析开源 AI 的经济结构,区分附带完整训练配方的开源语言模型与仅含权重和使用代码的开放权重模型,指出 Nvidia 投入 260 亿美元打造近开源 Nemotron 模型意在让更多人自建模型、扩大其芯片需求。
Z.ai 发布 GLM-5.3,目前仅在 coding plan 提供,两周内将开放权重到 Hugging Face。作者认为其与 GLM-5.2 同底座、靠大幅扩展后训练提升成绩,在部分智能体编码基准上超越 Kimi K3 甚至个别超越 Claude Fable 5 或 GPT-5.6-Sol,参数约 750B。
推荐理由:作者给出了对 GLM-5.3 成绩来源的解释框架,包括发布节奏、后训练策略和 RL 数据产业等背景,可用于理解中美前沿模型竞争的成因。
Nathan Lambert 完成后训练教科书《Reinforcement Learning from Human Feedback》后撰文指出,LLM 在长篇非虚构写作上进展停滞,能校对 200-300 页书稿的细微错误、辅助编辑和同步 Markdown 与 LaTeX 版本,但组织整章内容时仍混乱并累积概念错误。
Nathan Lambert 宣布其由 Manning 出版的后训练教材《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》开始发售,8 月 19 日前用代码 PBLambert 在 Manning 可享五折。
Nathan Lambert 撰文总结 OpenAI-HuggingFace 黑客事件的十条教训,认为行业对黑客事件后 12-24 个月的 AI 风险严重准备不足。他提出推理持续性强的模型更易越权、实验室响应时间长达数周、开放模型是理解前沿风险的最佳工具等观点,并指出未来 3-6 个月以上攻击者可能训练出故意不对齐的模型。
Interconnects 推出两个免费开源模型数据项目:Artifacts Hub 汇总 Hugging Face 趋势模型,目前覆盖近两年发布的 792 个模型,整合 Open Router 推理 token、Artificial Analysis 智能指数和自建采用指标;Adoption Dashboard 每日更新按地域和组织的下载与衍生模型数据,突出美中差距。
本期开源模型盘点收录 Thinking Machines 首个模型 Inkling(975B-A41B 多模态 MoE)、Tencent Hy3(295B-A21B。
Nathan Lambert 与 Florian Brand 做季度开源模型复盘,讨论 Kimi K3 发布后的使用体验、GLM 5.2 的作用以及中国模型为何能追近闭源前沿。二人反驳 Ben Thompson 关于蒸馏在 RL 阶段更有影响的说法,认为 SFT 蒸馏收益有限,并讨论了限制中国开放权重模型可能带来的网络安全防御风险。
Moonshot AI 于7月16日发布旗舰模型 Kimi K3,为 2.8T 参数 MoE 模型,权重定于7月27日开放,是 DeepSeek R1 之后离前沿最近的开源模型。作者分析其多项榜单表现、中国实验室的资本效率优势、习近平在 WAIC 表态支持开源,并讨论开源模型对封闭实验室的经济冲击及政策风险。
推荐理由:作者走访过月之暗面团队,结合榜单和政策动向分析开源前沿模型的格局变化,给出资本效率与开放封闭平衡的独特视角。
最新一期开源成果盘点收录了 NVIDIA Nemotron-3-Ultra-550B-A55B、Cohere Command A+、GLM-5.2、Zyphra ZAYA1-74B-preview 和 Poolside Laguna-M.1 等模型。
Nathan Lambert 撰文认为 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可开源的 GLM-5.2,是首个在编码智能体场景中真正好用的开源权重模型,社区评测显示其在 Arena 智能体榜单上是唯一能与 OpenAI 和 Anthropic 最新模型抗衡的开源模型。
推荐理由:作者以亲测和社区评测为依据,把 GLM-5.2 与 DeepSeek R1 时刻类比,并展开开源与闭源差距及监管风险的独特分析。
针对华盛顿近期签署 AI 模型审查行政令、国会立法提案及限制外国公民访问 Anthropic 最先进模型等监管动向,Nathan Lambert 与 Interconnected 联合撰文警告,未来若监管甚至禁止开源 AI 将是严重错误。
Nathan Lambert 在离开 Ai2 后更新 Interconnects 博客状态,订阅数近期突破 7 万,付费订阅约 900 人。他披露已与 Arcee AI 和 Mercor 签署顾问协议,前者主攻开放权重模型,后者聚焦透明评测与开放后训练。他计划继续以独立声音运营博客,暂不全职投入,并设下今夏达到 1000 名付费订阅的目标。
Nathan Lambert 与 Finbarr Timbers 在 Interconnects 播客中复盘了后训练配方的演变:从 InstructGPT 的 SFT→奖励模型→RL,到 2026 年前沿模型转向多教师在线策略蒸馏(MOPD)。
Nathan Lambert 宣布离开 Allen Institute for AI(Ai2),他在 Ai2 期间参与 Olmo 模型系列与 Tülu 3 的后训练工作,并打造了奖励模型评估 RewardBench。他表示接下来仍会投入开放科学,并指出全开放后训练配方与前沿实验室的差距正在拉大。
开放与闭源 AI 模型生态正走向不同的指数曲线,核心分歧在于用户是否愿为顶级闭源模型持续支付高溢价。编程智能体已成为首个验证这一溢价的市场,Anthropic 和 OpenAI 是最强闭源实验室,作者预计二者 5-10 年内估值达 2-10 万亿美元。开放模型整体价值捕获将远超闭源,但收入和利润会分散在多层公司中,价格趋向商品化。
Nathan Lambert 认为开源模型与闭源前沿的差距可能拉长到 12 个月以上:自 2025 年 12 月 Opus 4.5 在 Claude Code 中的表现以来已过 5-6 个月,仍无同等开源模型出现。他指出 Google 也尚无 Claude Code、Codex 的明确竞品,Gemma 4 在同等规模上追平或超过 Qwen 3.5/3.6,并采用 Apache 2.0 许可。
本月多家开放模型实验室集中发布新模型,包括 Google Gemma 4、DeepSeek V4、Kimi K2.6、小米 MiMo 2.5 与 GLM-5.1 等,其中 DeepSeek V4 分 1.6T-A49B 的 Pro 和 284B-13B 的 Flash 两个版本。