跳到正文
原文
Dwarkesh Patel· Dwarkesh Patel·· 2026-06-26精选AI 评分65

Dwarkesh Patel:下一个突破是 AI 在工作中学习

The next big breakthrough will be AIs learning on the job

AI 导读

Dwarkesh Patel 撰文认为,实验室押注的 RLVR 训练未必能泛化到无法在数据中心内复现的现实领域,因为训练样本效率低且缺少可重放模拟器。

推荐理由

作者论证 RLVR 难以泛化到不可复现的现实领域,并梳理 OPSD 与模拟训练等让模型在工作中持续学习的可能路径。

来源:Dwarkesh Patel · dwarkesh.com