AI何时才算做出了科学发现?

AI何时才算做出了科学发现?

当一个AI系统提出一个从未有人想到过的生物学假设,而一位人类科学家在实验台上把它验证出来时,我们究竟该说这是“AI做出的科学发现”,还是“人类借助AI做出的发现”?这个问题在过去一年里,从哲学讨论一路搬进了真实的实验室。

上周三,Anthropic对外披露,公司早在今年年初就已悄然启动了一个分子生物学实验室——一个真正意义上的“湿实验室”。在这里,Claude智能体负责阅读文献、梳理已知事实、对尚未解决的生物学难题提出猜想;人类科学家则负责把其中最值得一试的猜想转化成可执行的实验方案,动手做实验,再把结果反馈回去。换言之,这是一个由AI出题、由人类交卷的闭环。

真正的问题不是“AI能不能做科学”,而是当我们决定把功劳分给它时,我们依据的究竟是什么标准。

AI早已进实验室,身份却始终含糊

事实上,AI与科学研究的结合早已不是新闻,只是它此前大多以“工具”的面目出现。2020年,DeepMind的AlphaFold 2在蛋白质结构预测上取得突破,被普遍视为AI改变生物学的里程碑;2024年的AlphaFold 3又把预测范围扩展到蛋白质与DNA、RNA、小分子之间的复合结构。2023年11月,DeepMind的GNoME一次性预测出约220万种新晶体结构,其中数十万种被认为具有稳定存在的可能。同年,卡内基梅隆大学的“Coscientist”系统用GPT-4驱动自动化实验平台,独立完成了化学合成的规划与操作。2025年2月,谷歌发布“AI co-scientist”,用多智能体架构生成可检验的研究假设;更早之前,Sakana AI的“The AI Scientist”则尝试把从选题、写代码到写论文的整条研究流水线自动化。

但这些案例大多停留在“生成假设”或“预测结构”这一步,真正动手验证的仍是人类。Anthropic的新做法之所以引人注目,恰恰是因为它把AI和湿实验室直接连在了一起——在一个有试管、有移液枪、有失败率的地方,让模型的猜想接受现实的检验。

什么才算一次“发现”?

要回答“AI是否做出了科学发现”,先要界定什么是一次发现。科学哲学通常要求至少满足几个条件:它必须是新的,必须是对的(或至少可被验证),必须被科学共同体理解和接受,并且最好能解释“为什么”。按这个标准,AlphaFold预测的结构在实验验证之前只能算“预测”;GNoME列出的晶体结构在合成出来之前也只是候选名单。

更棘手的是能动性问题。如果AI只是抛出一大堆假设,人类从中筛选出可行的那一个并完成实验,那么这与“随机生成器加运气”有何区别?支持者会说:一个研究生提出想法、导师设计实验,我们依然会把发现算在研究生头上。反对者则反驳:我们之所以把功劳给学生,是因为学生理解自己为什么提出这个假设,也能在实验失败时修正方向——而当前的模型,很难说具备这种理解。

学界目前的共识底线是:AI不能成为论文作者。Nature等期刊明确规定,作者必须对研究负责,而AI无法承担责任。于是问题被推到一个更现实的层面——不是“AI有没有署名权”,而是“当一篇论文的假设由AI提出、实验由人类完成时,我们该如何分配这份功劳”。

Anthropic为什么要建一个湿实验室

从商业角度看,这步棋并不难理解。过去两年,各家模型公司都在争夺“谁的模型最会做科学”的叙事。但“AI科学家”的口号喊得越响,验证的门槛就越高:一次真正意义上的实验闭环,比一百张漂亮的对标图表更有说服力。

但Anthropic的动机可能不止于此。这家公司长期把“可解释性”和“长时程任务能力”作为核心研究方向。让Claude在真实实验室里连续数周推进一个课题,既是能力测试,也是安全测试——如果模型能在较少监督的情况下设计实验,那么它在其他领域能做什么?实验室里的失败和意外,恰恰是观察模型如何纠错、如何承认无知的最佳窗口。

答案或许不在“是”与“否”之间

与其争论AI是否“做出”了发现,不如承认一个更混沌的现实:现代科学发现本身正变得越来越集体化。一个结论的产生,往往要经过假设生成、实验设计、数据采集、统计分析、同行评审等十几个环节,而AI正在其中越来越多地占据位置。我们沿用了几百年的功劳分配体系——第一作者、通讯作者、致谢名单——根本没有为“非人类的贡献者”预留位置。

真正的挑战或许不是技术,而是制度。当一篇论文的核心假设来自一个语言模型,当一次关键实验由AI规划,我们需要的可能是一套新的署名与归因规范,而不是一句简单的“AI立功了”或“AI只是个工具”。

回到最初的问题:什么时候我们才能说AI做出了一次科学发现?也许答案不是某个时间点,而是一个过程——当AI不仅能提出假设,还能理解自己的假设为什么可能成立、失败之后知道如何修正、并且其贡献能被一个可追责的机制记录下来时,我们才会心甘情愿地把“发现”这个词分它一半。

本文编译自MIT Technology Review