AI安全沦为表演:让企业自我监管,只是假装做了什么

AI安全沦为表演:让企业自我监管,只是假装做了什么

编者按:过去三年,全球AI治理领域最稳定的产出不是技术突破,而是一份又一份措辞相似的“自愿承诺”。企业签得爽快,政府宣布得高调,可当真正的风险摆在面前时,没有人能说清这些文件究竟约束了谁。WIRED资深编辑Brian Barrett的这篇评论,把矛头对准了这套自我监管的仪式。

要求AI公司自我监管,是假装自己完成了某项工作的绝佳方式。

一纸接一纸的“自愿”接力赛

这套剧本我们已经看过太多遍。2023年夏天,美国白宫召集多家头部AI公司,宣布一批关于安全测试与信息共享的自愿承诺;同年11月,首届AI安全峰会在英国布莱切利庄园召开,多国政府与实验室共同签署宣言,把“前沿模型”的极端风险写进了正式文本;2024年的首尔峰会进一步要求企业承诺,在无法排除灾难性风险时暂停相关开发。每一次会议结束时,聚光灯下的都是同一批公司,而它们做出的都是同一件事——承诺自己会小心。

这些承诺听起来并不空洞:设立内部安全委员会、发布“负责任扩展政策”或“前沿安全框架”、在模型发布前进行红队测试、在一定算力门槛以上开展风险评估。问题不在于文本写得好不好,而在于所有这些动作的执行者、裁判者与解释者,都是签署承诺的那家公司自己。

自己出题,自己答题,自己打分

真正的监管有一条不可退让的原则:评估者必须与被评估者分离。而在当下AI产业,这条原则近乎全面缺席。所谓“危险能力阈值”由企业自行定义,触发阈值的测试由企业自行设计,测试结果由企业自行解读,是否发布模型最终也由企业自行决定。外界能看到什么,取决于企业愿意披露什么。

更现实的变量是竞争压力。任何一家公司如果单方面放慢脚步,就等于把市场份额、算力合同和顶尖人才拱手让人。在这种激励结构下,安全团队的意见天然处于弱势。过去两年间,多家实验室的对齐与安全团队经历了人事动荡与重组,一些公开表达担忧的研究者选择离开,而模型迭代的速度没有任何放缓的迹象。这不是某个人品行的失败,而是结构使然:当安全是成本、速度是收益时,结果早已注定。

于是出现了“安全洗白”这一现象——用一整套专业术语、组织架构和年度报告,把未受约束的开发行为包装成审慎治理的成果。对投资者和公众而言,这看上去像监管;对企业而言,这更像是护城河与免责声明。

真正的安全长什么样

如果认真对待AI安全,需要的恰恰是那些企业最不愿意主动提供的东西:具备法定权限的第三方独立审计,拥有查看权重、训练数据与内部记录的权利;强制性的事故与险情上报机制,让每一次接近失控的事件都留下公共记录;针对超过特定算力门槛的训练任务实行许可或备案制度;以及最重要的——清晰的责任归属,让造成实际损害的公司承担法律后果,而不是靠一纸声明获得豁免。

这些方案并不新颖,也并不极端。航空、医药、核能领域早已采纳类似逻辑,因为没有任何一个行业能够长期靠自律来管理可能造成大规模伤害的系统。真正的新意只在于,AI行业成功说服了相当一部分政策制定者,让它成为例外。

阻力同样清晰可见。以美国加州曾尝试立法为前沿模型设定安全义务为例,法案在行业密集游说后被否决,反对理由集中在“会扼杀创新”“会把企业赶出本州”。这套论证在每一次技术监管辩论中都会重演,而它的效果始终如一:把公共安全议题转化为产业竞争力议题,从而推迟任何有约束力的规则落地。

结语:自我监管不是安全的前奏,而是它的替代品

有人会说,自愿承诺总比什么都没有强,是迈向正式监管的第一步。但三年过去,这条路上的脚印并没有通向任何具有约束力的制度,反倒成了立法停滞的完美借口——既然企业已经“自愿”做了,为什么还要劳师动众立新法?自我监管最大的危害,不是它做得太少,而是它让不做变得合理。

AI公司当然可以继续发布安全框架、举办安全峰会、聘请安全负责人。这些动作本身没有错。但如果评价AI安全的唯一标准,仍然是企业自己写下的自我评价,那么无论措辞多么严谨,它都只是一场关于责任的表演。判断一个社会是否认真对待某项风险,看的从来不是它发表了什么宣言,而是它愿意让谁承担后果。

本文编译自WIRED