别被大模型骗了:它们根本不会推理

别被大模型骗了:它们根本不会推理

2016年3月,首尔。我坐在棋盘前,看着自己参与构建的程序在围棋棋盘第五线落下一子——那看起来像是送给人类对手的一份大礼。五番棋第二局的第37手,如此荒谬,以至于一些评论员以为出现了bug。但几个小时后,这步棋被证明是天才之举。AlphaGo赢了,而围棋界被永远改变了。

那一刻,许多人相信:机器已经学会了“直觉”,甚至“推理”。

但八年过去,当我看到大语言模型写出流畅的代码、通过律师资格考试、甚至“解释”量子力学时,我意识到一个危险的误解正在蔓延:我们正在把统计模式匹配,错当成真正的推理能力。

AlphaGo不是大语言模型——它们有本质区别

需要澄清的是,AlphaGo与今天的LLM(大语言模型)走的是完全不同的技术路线。AlphaGo结合了深度神经网络与蒙特卡洛树搜索,它通过自我对弈探索围棋的博弈树,在每一步都进行“如果……那么……”的前瞻性计算。换句话说,它确实在搜索、在规划、在评估——这些是推理的核心要素。

而大语言模型呢?它们本质上是“下一个词预测器”。给定一段文本,模型根据训练数据中的统计规律,预测最可能出现的下一个词。这个过程没有任何显式的搜索、规划或因果推断。

你可以说LLM“知道”巴黎是法国首都,因为它在训练中无数次看到这个事实。但当你问它“如果巴黎不在法国,法国首都可能是哪里”时,它给出的答案往往暴露出它没有真正的地理概念——它只是把“巴黎”“法国”“首都”这几个词在向量空间中的关联模式重新排列组合。

为什么我们容易被“推理假象”迷惑?

人类是模式识别的动物。当一段文字逻辑连贯、术语准确、语气自信时,我们本能地认为作者具备理解力。LLM恰恰擅长生成这样的文本。它们从海量数据中学会了“看起来像推理”的语言模式:先提问题,再列论据,最后给结论。

但这种“推理”是脆弱的。只要改变问题的措辞,或者加入无关的干扰信息,模型的输出就可能完全崩溃。真正的推理应该具备系统性、一致性和可迁移性——而LLM在这些维度上表现糟糕。

更令人担忧的是,我们正在把越来越多的决策权交给这些系统。从医疗诊断到法律咨询,从金融风控到军事指挥,如果决策者误以为LLM在“思考”,他们就可能忽视一个根本事实:模型只是在计算词序列的概率。

“随机鹦鹉”论战:我们需要更清醒的认识

2021年,Emily Bender等人发表著名论文,将LLM称为“随机鹦鹉”——它们只是在重复训练数据中的语言模式,没有真正的理解。这一观点引发了激烈争论。一些研究者认为,规模足够大时,推理能力会“涌现”。

但到目前为止,没有任何证据表明LLM学会了形式逻辑或因果推断。它们在标准基准测试上的高分,往往来自对测试数据的隐性记忆,而非真正的泛化能力。当面对需要多步推理的新问题时,它们的表现急剧下降。

我并非否定LLM的价值。它们在翻译、摘要、代码补全等任务上非常有用。但“有用”不等于“会推理”。计算器很有用,我们不会说它会推理;搜索引擎很有用,我们不会说它理解世界。

结语:别让“推理”成为营销话术

AI领域有一种危险的倾向:把每一个技术进步都包装成“迈向通用人工智能的一步”。LLM的能力被夸大,它们的局限被掩盖。公司需要融资,媒体需要头条,研究者需要关注——于是“推理”成了一个方便的标签。

但作为科学家和工程师,我们有责任说清楚:今天的LLM不会推理。它们没有世界模型,没有因果理解,没有逻辑一致性。它们只是非常擅长预测下一个词。

如果我们继续混淆“流利的语言输出”与“真正的推理”,我们不仅会高估AI的能力,还会在关键应用中犯下严重错误。第37手之所以伟大,是因为AlphaGo真正搜索了未来。而LLM只是在对过去进行统计拟合——这二者之间,隔着一道尚未跨越的鸿沟。

本文编译自MIT Technology Review