AI模型智力测试翻车,你能过关吗?

AI模型智力测试翻车,你能过关吗?

在人工智能的发展历程中,谜题与游戏始终扮演着特殊的角色。正如人类喜欢用填字游戏或逻辑谜题来检验自己的智慧,AI研究者们同样设计了一系列“智力训练场”,试图衡量模型的能力上限。然而,最新的研究却揭示了一个令人玩味的事实:AI模型在这些智力测试中屡屡失手,而人类却能轻松过关。这不禁让人发问:是这些测试本身不够“智能”,还是AI的智能与我们相去甚远?

从图灵测试到游戏AI:一部测试史

早在1950年,图灵就提出了“机器能否思考”的著名设问,并设计了模仿游戏。1959年,IBM计算机科学家Arthur Samuel首次将“机器学习”引入大众视野,他通过西洋跳棋程序展示了机器自我对弈学习的能力。此后,棋类游戏、拼图、解谜便成了AI研究的试金石。

“机器学习是给予计算机无需明确编程就能学习的研究领域。”——阿瑟·萨缪尔

从深蓝击败国际象棋世界冠军,到AlphaGo战胜围棋顶级棋手,再到AI在《星际争霸》中操控全局,游戏始终是检验AI水平的标尺。近年来,随着深度学习的兴起,研究者们发明了更为复杂的“认知测试”——它们并非基于规则的游戏,而是抽象推理、视觉空间判断、甚至微妙的常识问题。这些测试原本被认为只有人类能够解决,但如今AI模型也被推上考场。

AI为何在智力测试中“翻车”?

根据MIT Technology Review的报道,最新一代的AI模型在多种智力测试中的表现远逊于人类。这些测试往往要求模型理解图像中的隐藏关系、推测物体运动轨迹,或是对日常情境做出符合常理的判断。看起来简单的题目,却足以难倒目前最先进的系统。

专家指出,这暴露了当前AI的深层缺陷。以深度学习为基础的模型擅长从海量数据中寻找统计规律,并能迅速完成模式匹配。然而,这些模型并不具备真正的“理解”。它们能在训练数据涵盖的范围内游刃有余,一旦遇到需要因果推理或常识映射的新问题,便会露出马脚。换句话说,它们能“看出”答案,却不懂得为什么答案是对的。

人类:相对论式的“作弊”

那么,人类是如何在这些测试中占据上风的?认知科学家认为,人类从小就通过物理交互、语言交流等途径积累了大量“世界模型”。我们不需要显式地学习所有情况,就能直觉地判断一个玻璃杯从桌上掉落会发生什么,也能理解物体的遮挡关系。

这种常识能力,被许多研究者视为AI真正的“圣杯”。虽然大模型在自然语言处理上取得了惊人成就,但它们在物理世界的直觉上仍然像婴儿一样薄弱。智力测试恰恰像一面镜子,照出了AI“内存”与“理解”之间的鸿沟。

编者按:别让测试成为新的“图灵测试”

值得注意的是,AI评测从来都不是一件简单的事。不同测试的侧重点各不相同,而AI的表现往往会因任务描述、上下文提示甚至随机种子而产生巨大波动。一次失败并不能说明模型没有智能,但频繁暴露的“低级错误”确实提醒我们:当前AI的能力是窄而深的,而非全面接近人类。

正如Arthur Samuel的跳棋程序在当时被视为“机器学习”的里程碑,今天的智力测试也许只是另一种衡量手段。它们不是终点,而是一种对话——在探索智能的路上,我们既在训练模型,也在重新认识自己。

本文编译自MIT Technology Review