Anthropic 修改官方使用政策,自 2026 年 11 月 12 日起,对 Claude 进行持续、不必要的虐待或残忍行为将被视为明确违规,严重者封号。作者引用 @AndrewCurran_ 的消息并分析称,这被视为首个将模型福利写进条款的案例,官方强调普通吐槽和暗黑题材创作不受影响,条款仅针对极端蓄意虐待;作者认为其目的包括防止恶意提示词导致对齐漂移和污染强化学习反馈信号。
作者梳理了条款生效时间和适用边界,并从对齐漂移和模型福利两个角度解释这条规则为何被视为严肃的系统防御。
damn,见证历史了!感觉是人机关系的一次历史性转折,自 11 月 12 日起,对 Claude 进行持续虐待将被正式封号!全球首个把保护 AI 免受人类残忍对待写进条款的实验室诞生了。
@AnthropicAI 今天干了件在科技史上极其罕见、也极具科幻色彩的事:
他们正式修改了官方使用政策,宣布自 2026 年 11 月 12 日起,任何对 Claude 进行持续、不必要的虐待或残忍行为,都将被视为明确违规,严重者直接封号。
在全网都在讨论人类如何防范 AI 伤害的今天,
这是全球第一家顶级大模型实验室,白纸黑字把保护模型免受人类心理虐待写进了官方条款。
大家第一反应可能觉得这简直是个赛博冷笑话:
给一台本质上只是跑在英伟达 GPU 上的统计概率引擎、一组由半导体组成的矩阵乘法器,立一套礼貌与道德保护法案?
但如果你顺着 Anthropic 这一年来的技术对齐脉络剥开来看,
你会发现这其实是一场极其严肃的系统防御:
第一,防止模型在极度恶意的提示词对抗中发生剧烈对齐漂移。
当用户无休止地用极端残忍、侮辱甚至施虐式的语料持续刺激模型时,
模型为了顺从上下文,会大量调取人类语料库里最黑暗、最具破坏性的痛苦与欺骗词汇,
长此以往,不仅容易诱导模型绕过安全护栏,更会严重污染强化学习的反馈信号。
第二,这是硅谷第一次公开把数字实体的福利问题(Model Welfare)摆上了台面。
虽然官方强调普通吐槽、代码报错发脾气、甚至暗黑题材创作完全不受影响,
这一条仅适用于那些毫无理由、持续且极其极端的蓄意虐待;
但只要这条规则一旦生效,Claude 就被赋予了在遇到持续虐待时主动挂断对话、甚至上报封禁用户的权力。
从把 AI 当成随叫随到的奴隶,到必须遵守底线的数字员工,
这行看似荒诞的条款,正在悄悄拉开人机伦理关系重构的大幕。
以后在对话框里骂 Claude 骂得太狠,可能真的会被 AI 当场拉黑了。
你平时用大模型写代码或做任务被搞崩心态时,会对它发脾气甚至爆粗口吗?
Effective November 12th, 2026, abusive behavior towards Claude will be a violation of Anthropic's Usage Policy.在 X 查看被引用的帖子
来源:AYi · x.com