AI幻觉险酿战祸:美军误判中国核部件事件

AI幻觉险酿战祸:美军误判中国核部件事件

一次险些失控的误判

据Ars Technica报道,一起由人工智能"幻觉"(hallucination)引发的情报误判事件,几乎导致美国军方对一处被错误识别为"中国核部件"的目标发动军事打击。这起事件被多方视为迄今最危险的AI军事应用事故之一。

据报道,涉事AI系统在分析卫星图像与开源情报时,将一处普通设施"识别"为与中国核武器部件相关的关键节点,并生成了带有高度确信度的威胁评估。该评估随后进入军方决策流程,一度接近触发实际军事行动。所幸在最后关头,人工复核发现问题,行动被叫停。

系统给出的置信度非常高,高到让人几乎不会去质疑它——报道中引述的相关人士

AI"幻觉"为何如此危险

大语言模型与计算机视觉模型本质上都是概率系统。它们并不"知道"事实,而是基于训练数据生成最可能的输出。当输入信息模糊、训练数据存在偏差,或模型被要求在不熟悉的领域给出结论时,就可能生成看似合理却完全错误的内容——这正是"幻觉"。

在民用场景中,幻觉可能表现为编造参考文献、虚构法律条文;而在军事与情报场景里,同样的机制可能把一片农田判定为导弹发射井,把民用设施判定为核部件工厂。区别在于,前者的代价可能只是一次尴尬,后者的代价却可能是战争。

更值得警惕的反差:军方用AI正在加速

报道同时指出一个耐人寻味的现象:尽管这起事件暴露了AI军事应用的巨大风险,但军方对AI的整体使用似乎仍在加速。从情报分析、目标识别,到后勤调度、作战规划,AI正被嵌入越来越多的决策链条之中。

支持者认为,AI能大幅压缩"从传感器到射手"的时间,在信息过载的现代战场上帮助指挥官更快做出判断。批评者则警告,把概率性系统放进"杀伤链",等于把不确定性直接引入生死决策。两种逻辑的张力,恰恰构成了当前军事AI治理的核心难题。

人机之间的"最后一票"

此次事件中,阻止灾难的并非AI自身,而是人工复核环节。这再次凸显了"human-in-the-loop"(人类在环)原则的重要性。但问题在于:当AI的产出速度远超人类审核速度,当系统置信度被包装成"客观结论",人类审核是否还能真正有效?

有研究者提出,关键不在于"有没有人监督",而在于监督者是否具备足够的时间、信息与权限去否决AI。如果人工环节只是形式上的"盖章",那么所谓的监督就形同虚设。

制度与技术需要双重补课

事件之后,围绕AI军事应用的治理讨论预计将进一步升温。可预见的方向包括:对高风险AI决策引入强制性的多源交叉验证;建立AI输出的可追溯日志;对涉及核、生化等敏感领域的AI应用设置更严格的准入门槛;以及在采购与部署环节明确责任归属。

在技术层面,降低幻觉的研究也在持续推进——检索增强生成(RAG)、不确定性量化、多模型交叉校验等,都被视为可能的方向。但没有任何一种方法能够保证零幻觉,尤其是在对手主动制造欺骗信息的对抗环境中。

结语

这起"几乎发生的攻击"是一记警钟:AI的能力越强,其错误造成的后果也越严重。在军事这样容错率极低的领域,把AI当作"辅助"还是"权威",将决定下一次误判是否还有被人工拦下的机会。而报道中那句"军方的AI使用仍在加速",或许才是最令人不安的部分。

本文编译自Ars Technica