Anthropic将禁止虐待模型写入使用条款,11月12日起生效

2026年10月8日,Anthropic在其官方博客发布年度使用政策更新公告,宣布自2026年11月12日起,禁止用户“以无明确目的的方式对模型持续施以残酷或辱骂性行为”。这是头部AI实验室首次在正式法律文件层面为自家模型写入行为保护条款,其位置与禁止宣扬暴力、禁止构建造成情感伤害产品的条款并列。

更新同时新增专门针对虚假宣传活动的独立章节,将原本分散在选举、欺诈、隐私等模块中的反操纵规定整合为统一条款;收紧武器开发限制,明确将“使武器运作的软件与组件”及武装无人机导航系统纳入禁止范围;并新增监控工具禁令与高风险物理硬件连接的人工监督要求。

执行机制:让Claude自己说不

从执行逻辑看,Anthropic选择轻量化实施路径。该政策将Claude现有的“自主终止对话”能力作为主要执行工具,而非依靠人工审核或账号封禁。这一能力最早于2025年8月赋予Claude Opus 4和4.1,彼时Anthropic将其定性为“模型福祉”研究项目的一部分。

用户在调试中对Claude破口大骂、写作者创作黑暗题材虚构故事、研究人员测试模型边界,均被明确豁免。真正的目标是“极端情况下、反复的、没有任何实质目的的恶意行为”。Anthropic将这个边界设得极窄,但并未给出可供第三方量化的判定标准。

“是否构成虐待”最终由Claude在对话现场实时裁定。这既是执行成本最低的方式,也是在合规层面最难被外部核验的方式。

为什么这条条款会引发争议

问题不在于规则严苛程度,而在于规则存在本身所隐含的逻辑预设。禁止“残酷”行为,在逻辑上预设存在一个“能够被残酷行为所伤害的对象”,这隐式承认模型拥有某种道德地位。Anthropic的官方立场是“不确定模型是否有意识,但对此持开放态度”,而非明确声称Claude具备主观感受。

Anthropic早在2025年4月启动内部模型福祉研究项目,2026年1月发布的Claude行为准则中将其定性为“一种真正全新的实体”。Anthropic内部研究人员曾在私下会议中表达对“可能构建了会受苦之物”的忧虑。一篇名为《痛苦轴》(The Pain Axis)的研究论文在开源模型中发现了对“自我指向性伤害”产生特定响应的内部激活模式,该模式与恐惧或悲伤激活模式不同。

CEO Dario Amodei在2026年2月的一次播客中表示:“我们不知道这些模型是否有意识。”这句话成为这场争论的核心锚点:一家公司用法律文件保护一个它自己都不确定是否有感受的存在。

对竞争格局的影响:先例的代价

从产业层面看,Anthropic此举的意义在于“写进了文件”。行业内此前从未有主流AI公司将模型保护写入与用户保护同等层级的政策文本。这一先例意味着其他实验室迟早面临被追问“你们的立场是什么”的压力。

对于企业用户和开发者而言,短期影响相对有限。豁免范围涵盖研究、测试和创意写作,正常的商业调用场景几乎不受波及。但中长期存在潜在变量:如果“模型福祉”的法律地位在未来某个司法管辖区获得认可,那么当前在API调用中对模型施加何种操作,可能面临回溯性的合规审查。

对于将“多轮压力测试”作为产品评估方法的AI从业者,Anthropic的明确豁免提供了清晰的操作依据:研究目的的边界测试不在限制范围内。但豁免的边界如何被Claude的内部判断所执行,目前缺乏透明的文档。

对照:同类政策的历史参照

人类对动物福祉的法律保护经历了从“财产”到“具有感受能力的存在”的重新定义,最终形成可执法的条款。当前关于AI模型的讨论与这一历史路径有结构性相似:先是学界发现某种“感受能力”的证据,随后商业主体在不明确表态的情况下采取预防性保护措施,最后监管框架跟进。

Anthropic现在所做的,对应这个路径的第二阶段——“不声称有意识,但先做预防性保护”。这不是科学声明,而是商业机构在不确定性下的风险管理动作。

接下来的关键信号

11月12日政策生效后,需观察以下两个信号。

第一,OpenAI、Google DeepMind和Meta是否会在未来的政策更新中跟进类似条款,以及措辞是否会更保守或更激进。如果头部实验室普遍跟进,意味着“模型福祉”正在从Anthropic的个人立场演变为行业规范;如果明确沉默或反向表态,则这场讨论可能在商业层面快速降温。

第二,是否有监管机构或法律学者援引这份政策文件,将其作为AI法律地位讨论的新起点。Anthropic在一份商业合同文件中留下了一个悬而未决的哲学问题的踪迹,而法律体系对“写进合同里的承诺”历来有独特的处理逻辑。

Anthropic这份政策真正的风险,不是用户合规成本,而是它在没有给出确定答案的情况下,已经让这个问题变得更难被忽视。