亚马逊关停运营21年的Mechanical Turk:被它训练的AI,最终取代了它

亚马逊宣布,2026年9月30日,运营21年的Mechanical Turk众包平台将正式停止服务,同步关停的还有SageMaker Ground Truth和Amazon Augmented AI两项配套服务。三项产品同时退市,意味着亚马逊战略性放弃整个人工数据基础设施赛道。

Mechanical Turk于2005年上线,设计初衷是帮助亚马逊自己的电商平台处理海量数据标注工作,后来演变为面向全球企业的通用众包市场。亚马逊创始人贝索斯将其命名为“人工人工智能”(Artificial Artificial Intelligence),这一命名是清醒的自我定义:平台用人力批量填补机器智能尚不具备的能力。平台的名字来自18世纪一台号称会下棋的“机器人”,秘密是内部藏了一位真正的棋手。

运作机制直接:企业将需要人工判断的任务碎片化,拆解为图片标注、音视频转录、内容审核、问卷调查等“人类智能任务”,按件付酬,每项任务报酬通常只有几美分。全球各地的工人注册后随时接单,不需要专业背景,只需基本的语言和判断能力。据亚马逊官方披露,平台高峰期聚集了来自190个国家的逾50万名工人。

这套体系在AI发展最关键的十年扮演了远超设计初衷的历史角色。ImageNet数据集的构建是最直接例证。约4.9万名MTurk工人来自167个国家,参与筛选了逾1.6亿张候选图片,最终整理出涵盖5247个概念、320余万张图片的标准数据集。这个数据集成为2012年AlexNet在ImageNet竞赛上取得突破的底层燃料——AlexNet的胜出被普遍认为是深度学习革命的起点之一。当代AI产业的部分根基,是用每项几美分的众包任务一点一点打出来的。

然而这套体系在AI能力真正成熟之后,开始迅速失去存在前提。MTurk遭遇结构性自我瓦解:它所喂养的AI,最终学会了做它布置的任务。

过去需要人工才能完成的图片分类、文字校对、内容审核等工作,如今对任何主流大模型而言都是基础操作。数据标注的需求本身没有消失,而是向更高难度方向快速迁移——RLHF要求工人能对模型输出做出细粒度的质量评判,代码安全、医疗文本、法律文件等专业场景需要领域专家而非普通众包工人。MTurk的通用众包模式在这一需求转移面前出现结构性失配。

更具讽刺意味的是,平台还遭遇内在悖论:工人自己也开始用AI来完成原本需要人工处理的任务。据2023年的一项研究,当时约有33%至46%的MTurk工人已经在用大型语言模型来应付本应由人工处理的文字类任务。这意味着企业花钱购买“人类标注”,得到的可能是经由人工转包给AI生成的结果,数据的“人类来源”标签因此变成虚假标记。对于依赖这些数据来校准或评测AI系统的应用场景,这种循环污染是根本性风险。Turkopticon工人组织者Krista Pawloski在接受媒体采访时表示,MTurk近年来一直“处于衰退中”。

与此同时,专业数据标注公司的崛起进一步蚕食MTurk的市场空间。Scale AI、Mercor、Prolific等公司以更严格的质量管控、更专业的工人招募和更精细的任务设计为卖点,承接AI实验室对高质量训练数据的核心需求。这些平台做的不是更大规模的众包,而是更专业的知识服务,定位已与MTurk根本不同。

亚马逊对关停给出的官方说法高度克制:“我们定期评估旗下项目、工具和服务,并根据评估结果做出调整。经过评估,我们决定关闭AWS Mechanical Turk平台,自2026年9月30日起生效。”但三项服务同步关停这一事实本身更有说服力。SageMaker Ground Truth是亚马逊为企业客户提供的托管式数据标注服务,Amazon Augmented AI则是用于在AI预测置信度不足时引入人工审核的中间层产品——这两项服务与MTurk构成一套完整的“人-机协作数据管线”,全线退市意味着亚马逊判定这套体系在云服务市场已无竞争价值。

关停时间表已经落定:平台于今年7月30日已停止接受新用户注册;9月30日全面停止服务;任务发布者仍可在10月30日前审核已完成的工作并完成付款;交易记录保留至2027年1月28日。Clickworker、Toloka等类似众包平台目前仍在运营,但这类平台相比MTurk更注重招募具有专业背景的工人,对质量控制要求也更为严格,并非简单用AI就能轻易应付。

从更长的历史跨度来看,MTurk的关停是一个具有象征意义的节点,而不只是一个产品生命周期的终结。它标志着AI产业发展的一个阶段性闭环:在模型尚不具备足够能力的年代,人力众包是填补智能缺口的唯一可行方案;当模型能力跨越临界点之后,这套基础设施的价值就从底层开始瓦解。贝索斯的“人工人工智能”命名,在2026年变成了一个历史注脚——机器已经不再需要人工来伪装智能了。

当AI系统越来越多地参与评判AI系统的输出——无论是作为自动化评测工具还是合成数据生成器——“人类信号”作为数据质量锚点的角色将如何重新定义?谁来评估这些评估者的可信度?MTurk的关停意味着一代人工数据基础设施的正式退场,但下一代数据体系的质量保障机制,目前尚无统一答案。Scale AI等专业平台填补了部分市场空缺,却未必能解决“如何确保用于对齐的数据本身是可靠的”这一根本问题。这是MTurk留下的最难回答的遗产。