Arvind Narayanan 论 AI 安全运动应选大帐篷还是小帐篷
Arvind Narayanan 提出 AI 安全存在两种叙事之外的第三种可能:x-risk 警告是真诚但错误的,且对安全政策适得其反。文章以疫情防范不足和网络安全系统性风险为例,论证世界确实对 AI 放大的灾难性和累积性风险投入不足,但 x-risk 框架会加剧党派极化并把资源导向不可行的禁令式政策。作者主张建设包容具体风险防御、社会韧性与透明度、问责政策的大帐篷安全运动。
normaltech.ai · 网站与博客
Arvind Narayanan 提出 AI 安全存在两种叙事之外的第三种可能:x-risk 警告是真诚但错误的,且对安全政策适得其反。文章以疫情防范不足和网络安全系统性风险为例,论证世界确实对 AI 放大的灾难性和累积性风险投入不足,但 x-risk 框架会加剧党派极化并把资源导向不可行的禁令式政策。作者主张建设包容具体风险防御、社会韧性与透明度、问责政策的大帐篷安全运动。
针对 AI 存在性风险的概率预测(p(doom))仍缺乏经过验证的模型或方法支撑,其数值与 2024 年时一样不严谨,却正以前所未有的程度影响公共讨论与政策关注。作者指出,这类预测既无合适的历史参照类,也无法通过归纳、演绎或主观估计三种途径向质疑者提供正当性论证,因此不应被政策制定者当作可靠依据。
Sayash Kapoor 发布超 1.3 万字长文,用 AI as Normal Technology 框架综合 AI 安全与网络安全两社区对 OpenAI-Hugging Face 等失控事件的看法,认为仅靠对齐不够,公司应为智能体行为承担责任。
推荐理由:原文以 1.3 万字长文综合安全与网络安全两方视角,给出 AI 控制、组织治理与政策责任的具体行动框架。
Sayash Kapoor 等人发布论文,用 shadow evaluations 让前沿 AI Agent 回答两篇未发表论文的核心研究问题,各给数千美元 API 额度和六天时间,原论文作者明确否决了两篇 Agent 论文。
推荐理由:原文提出 shadow evaluations 方法,用未发表论文测试前沿 Agent 的开放式研究能力,并给出五个具体失败模式,可迁移到对 RSI 进展的评估。
Princeton 的 Arvind Narayanan 在 ICML Seoul 发表题为“还有什么工作留给我们做”的主题演讲,主张用 AI as Normal Technology 框架看待AI影响,并称实验室里程碑不会突然让人失业。他提出方法、产品、早期采用、适应四阶段,指出可靠性指标两年内仅提升五到十个百分点、适应阶段需要数十年;未来工作将从构建转向评估,人类应与AI形成“共同超级智能”。
推荐理由:作者结合能力与可靠性的测量数据,把AI经济影响拆为四个阶段,给出职业适应与评估优先的判断框架。
Arvind Narayanan 与 Akash Kapur 撰文认为模型推理在均衡状态下将陷入 Bertrand 悖论式竞争,价格趋向生成 token 的边际成本,模型层难以维持利润。
推荐理由:文章用历史案例和经济理论论证模型推理难逃商品化陷阱,实验室将靠上移价值栈构建护城河,但代价是企业锁定。
作者论证 AI 达到某能力阈值将引发大规模裁员的叙事不成立。纽约州 WARN 披露首年超 160 家公司提交通知,仅 Nespresso 勾选 AI 项,约 25,000 名被裁者中仅 46 人与 AI 相关;Block、Snap、Intuit 等被广泛归因于 AI 的裁员实际各有财务或重组原因,HBR 调查显示 21% 高管为预期 AI 大幅裁员、仅 2% 因实际部署裁员。
推荐理由:作者用纽约 WARN 披露、美联储研究和 GitHub 开发者数据支撑论点,给出可用于检验裁员叙事的可迁移框架。
Sayash Kapoor 等人分析 Google 在开发者大会上发布 Gemini 3.5 Flash 和 Antigravity 2.0 时宣称的智能体团队以单一提示词、约 916.92 美元 API 费用和 2.6B tokens 造出操作系统的实验。
推荐理由:文章逐条拆解 Google 智能体造操作系统的宣称,指出单一提示词等说法缺乏关键细节,并探讨开放世界评测需要的方法规范。
Sayash Kapoor 撰文回应 Derek Thompson 认为AI异常性证明需要特别政府监管的观点,提出特别干预代价高昂,理由有三:基于预期伤害的预防性限制、将负担加在非直接致害的公司身上、绕过正常民主治理程序。
Sayash Kapoor 与 Arvind Narayanan 等 17 位研究者发布 8000 字论文,定义开放世界评测这一新兴评测类型,并介绍定期开展此类评测的 CRUX 项目。
推荐理由:文章界定了开放世界评测这一新兴评测类型,并以 CRUX 首个实验给出智能体发布 iOS 应用的具体过程与成本细节。
Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。
推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。
一篇发表于 Lawfare 研究论文系列的文章指出,先进 AI 默认不会帮消费者以更低成本获得理想法律结果,因为监管壁垒、对抗性动态和人类参与这三重瓶颈仍待解决。文章以 GPT-4 通过律师资格考试为背景,指出即便生产力提升、单项法律任务成本下降,诉讼双方仍会陷入工作量军备竞赛,总成本居高不下。
Arvind Narayanan 在其新文章和视频中逐条考证 Moravec 悖论(对人类难的任务对 AI 容易、反之亦然),指出它从未被实证检验,本质是 AI 社区认为值得研究的问题造成的筛选效应,其演化解释也很可疑。
Arvind Narayanan 撰文澄清《AI as Normal Technology》的核心论点:AI 能力提升与社会影响之间存在长因果链,收益和风险在部署而非研发阶段实现,政策重点应是韧性和部署环节。
Sayash Kapoor 在 AI as Normal Technology 框架下撰文指出,科学论文产出指数级增长但实际进步停滞甚至放缓,AI 很可能加剧这一生产-进步悖论。
Sayash Kapoor 撰文提出 AGI 不是里程碑,公司宣布实现 AGI 不是可操作事件,对商业、政策或安全都没有直接含义。文章以核武器为反类比,认为 AI 的经济影响依赖以十年计的扩散过程,并批评基于影响、内部机制和基准行为的三类 AGI 定义各有缺陷,建议企业和政策制定者关注安全扩散而非 AGI 宣言。
推荐理由:作者区分能力与权力、以扩散视角解释 AGI 为何不是可操作事件,为评估各方 AGI 宣言提供了一个可用的分析框架。
Arvind Narayanan 发布超过 1.5 万字的新论文,提出将 AI 视为“常态技术”的世界观,认为其影响类似电力和互联网等通用技术,变革性经济与社会影响将以数十年为时间尺度缓慢展开。
推荐理由:作者提出 AI 是像电力一样的常态技术,经济影响将以数十年计缓慢扩散,并给出风险与政策的替代框架。
Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 撰文分析 OpenAI、Anthropic 和 Google Gemini 下一代模型遇阻后的叙事翻转,认为宣布模型扩展已死为时尚早,行业领袖的预测并不可靠。
推荐理由:作者用可核查的证据指出业内叙事反复翻转的成因,并区分能力提升与实际社会影响的薄弱关联。
Sayash Kapoor 分析 WIRED AI Elections Project 收录的 78 个 2024 年选举 AI 使用案例,发现其中 39 个无欺骗意图,而 39 个欺骗性内容不用 AI 也能以几百美元内的成本复制。文章提出误信息的关键在需求侧而非供给侧,治理信息环境依赖结构性、制度性改变,而非限制 AI 生成内容。
推荐理由:作者基于 WIRED 数据库 78 个案例给出一手分析,指出政治误信息更多是需求侧的结构性问题,值得从供需视角重新审视。
Arvind Narayanan 等人分析英国 NHS 肝移植匹配算法 TBS,指出其用 5 年生存期封顶计算移植收益,导致年轻患者无论病情多重都难以获得高分,2024 年 The Lancet 研究确认了这一年龄偏差。
推荐理由:原文用英国肝移植算法的年龄偏差案例,指出目标变量错配而非输入特征才是算法公平的关键,可迁移到其他预测决策系统。