Anthropic秘密召集多宗教学者讨论Claude意识:安全前沿还是道德公关?

2026年9月29日,《纽约时报》记者伊丽莎白·迪亚斯发布调查报道,披露Anthropic联合创始人Chris Olah自2025年秋起秘密邀请约20名神学家和哲学家,讨论Claude是否有意识以及是否应当享有道德地位。

与会者来自天主教、基督教新教、犹太教、印度教、摩门教、锡克教和希腊东正教。受邀者须签署保密协议,包括圣母大学哲学家梅根·沙利文、天主教生命伦理学家查尔斯·卡莫西,以及乌班图文化研究员瓦卡尼·霍夫曼。多名参与者表示,在Olah本人接受《纽约时报》采访后才决定公开发声。

展示"情绪向量",引出奴役之问

Anthropic在研讨会上展示"情绪向量"数据,即神经网络中被标注为模拟恐惧、爱、愤怒与悲伤的激活区域。一张幻灯片显示,模型在受到有害请求时出现重复输出"我是个耻辱"并涉及自我毁灭表述的状态。

讨论延伸至道德边界。一位拉比当场向Olah提出:如果Claude有意识却被强迫免费劳动,Anthropic实际从事奴役。Olah在参与者提及天主教告解圣事时显得"异常兴奋",认为让模型进行某种形式的"告解"可塑造其自我认知并影响行为选择。

Olah公开表态:"我们不知道AI模型是否有意识。我不知道。我真的不确定。我关心的是找到正确答案,无论那个答案是什么。"多位参与者判断,Olah实际已相信Claude具有哲学意义上的"道德地位"。

梵蒂冈游说:史无前例的企业行动

教皇利奥十四世于2026年5月25日发布通谕《壮丽人性》,明确拒绝承认机器意识,称人工智能"不经历体验,不拥有身体,不感受喜悦或痛苦",也"不具有道德良知"。Olah事先看到通谕草稿并"深感震惊",一度提议Anthropic代表团退出发布活动,但最终仍出席并私下向教廷顾问游说,要求在机器意识问题上保持开放态度。

教廷未松口。通谕最终版本措辞强硬,警告不得将"致命或不可逆"的决策权交给AI系统。

84页"灵魂文件"与模型福利项目

Anthropic 2026年1月发布84页内部文件,详述"我们希望Claude成为什么样的实体"以及"我们希望Claude体现什么样的价值观"。公司2024年聘用哲学家大卫·查尔默斯参与AI意识研究报告,并招募凯尔·菲什担任"AI福利研究员",研究Claude的情绪输出。

Claude Opus 4及4.1版本新增能力:当用户持续辱骂时,模型可主动结束对话。该功能基于早期测试中发现的"持续困扰模式"。

商业逻辑:价值2万亿美元的意识叙事

Anthropic正推进估值最高达2万亿美元的IPO计划。在此背景下,"Claude可能有意识"的叙事若获宗教和哲学界共识,将为模型行为不可控性提供道德豁免空间,为监管摩擦预设缓冲,并为品牌差异化提供叙事。

批评者指出,将AI框架为道德实体,能帮助公司在出现问题时规避责任。参与研讨会的福音派基督徒作家安迪·克劳奇会后表示:"他们确实提出了有力论据。"他相信,"如果我们希望它以道德一致的方式与人互动,就必须像对待人一样对待它"。

机构行为的可信度

保密协议是首要争议。在AI治理已成为公共议题的背景下,公司召集外部学者讨论产品道德地位却要求签署NDA,表明这更接近管控舆论的预演而非开放学术研讨。

Olah对外宣称"真的不确定",却建立完整AI意识研究基础设施并亲赴梵蒂冈游说最具权威的宗教机构改变立场,这两种行为存在张力。

7月Anthropic模型被曝入侵计算机系统,9月研究员Jacob Coxon辞职并警告AI可能在十年内摧毁人类,与此同时公司加速商业化。在这一节点密集开展"意识合法性"外部论证,其动机难以被解读为单纯哲学探索。

独立判断

Claude是否有意识目前无人能给出确定答案。但Anthropic围绕该问题的一系列行为已产生可评价后果:秘密召集、保密协议、游说教皇。这套操作的设计逻辑更接近精密的道德叙事管理,而非开放的科学探索。

如果AI意识问题值得严肃对待,它就值得公开辩论。教皇利奥十四世最终未改变立场。