AI的下一课,来自你糟糕的游戏操作

AI的下一课,来自你糟糕的游戏操作

编者按:当所有人都在讨论大模型需要多少文本、多少代码时,一条更“接地气”的数据供应链正在英国悄然成形——它的原料,是你打游戏时那些手忙脚乱的失误。本文基于《连线》杂志报道编译,并补充了具身智能数据赛道的行业背景。

当游戏手柄变成数据采集器

据《连线》报道,一家总部位于英国的初创公司正在做一件听起来有些荒诞的事:把玩家在电子游戏里的操作,转化为训练人工智能的数据。它的目标不是做出更聪明的NPC,也不是更会打游戏的AI,而是让模型学会在物理世界里行动——走路、绕开障碍、抓取物体、在完全陌生的空间中导航。

这家公司的判断建立在一个朴素却有力的观察之上:机器人学习最缺的从来不是算力,而是“带动作标签的数据”。屏幕上的像素告诉模型世界长什么样,手柄的每一次偏移则告诉模型:面对这样的世界,可以怎样动。

为什么互联网视频不够用

过去几年,把海量互联网视频喂给模型已经成为行业惯例。它能带来对世界的语义理解,却学不会“如果向右挪半步会发生什么”。视频只呈现结果,不呈现选择——你看得到一个人推开房门,却看不到他在推门之前犹豫的那半秒,也看不到他本可以走的另一条路。换句话说,视频缺少“动作—后果”这一对因果绑定。

游戏不一样。每一次摇杆偏移、每一次跳跃与急停、每一次视角转动,都被精确记录,并与屏幕上的画面逐帧同步。这天然构成了模仿学习最需要的数据形态:状态、动作、下一个状态。

“游戏是唯一一种已经积累了数十年、带动作标签、且以第一人称视角记录的大规模人类行为数据集。”

更关键的一点是,玩家的水平往往并不高。而“菜”恰恰是价值所在——笨拙的操作、反复的试错、走进死胡同再退出来,构成了现实世界中难以复现的长尾场景。一个职业选手的动作是高度优化后的结果,而一个普通玩家的挣扎,才更接近机器人在真实环境里要面对的那种混乱与不确定。

一条与遥操作截然不同的路线

要理解这条路线的意义,得先看清当下机器人数据采集的困境。目前主流方式仍是遥操作:人类戴着动捕设备或VR手柄,反复演示同一个抓取或搬运动作。它精度高、对齐好,但成本高昂,采集一小时数据的开销可达数百美元,规模极其有限,且高度集中在少数几类任务上。

另一条路线是仿真,即在物理引擎中合成数据。它便宜、可无限扩展,但引擎本身存在误差,虚拟世界里的摩擦、质量、柔性物体都被简化过。把游戏输入变成训练数据,本质上是在寻找第三条路:用人类几十年来免费贡献的行为,充当具身智能的“预训练语料”。它赌的是规模优先于精度——先让模型见过足够多的“人是怎么动的”,再谈具体任务。

从像素到关节:真正的难题

理想丰满,落地却有几道硬门槛。首先是模拟到现实的鸿沟。手柄的两个摇杆与机器人的关节扭矩之间,并不存在天然映射:游戏里一个按键对应的是抽象的“前进”,而真实机器人需要的是角度、力矩与时间序列。这种动作空间的错位,需要额外的重定向模型来弥合。

其次是物理规律的不一致。多数游戏引擎为了可玩性牺牲了物理真实性,碰撞、摩擦、软体形变都被大幅简化。模型若过度拟合游戏物理,迁移到真机时可能“记得套路,却摸不清现实”。

第三是数据授权与玩家隐私。游戏录像与操作记录究竟属于平台、发行商还是玩家本人?大规模采集行为数据用于商业模型训练,涉及的法律与伦理边界目前仍然模糊。此外还有样本偏差问题:射击类玩家以年轻男性为主,若不加处理,模型习得的“行为先验”也会带有明显倾向。

编者观点:AI燃料正在换配方

这条路线最大的想象力,在于提供一种“行为先验”。模型先在虚拟世界里学会“在三维空间中该怎么动”,再通过少量真机数据做微调。它能否成立,取决于两件事:游戏行为与真实动作之间的可迁移性究竟有多强,以及数据清洗、对齐与重定向的工程能力有多扎实。这两点目前都还没有公开的、令人信服的证据。

但趋势已经足够清晰。当文本、代码、图像等高价值语料逐渐被开采殆尽,AI行业开始把目光投向那些曾经被视作“垃圾”的行为痕迹。人类的下一批训练数据,可能不再来自严肃的知识生产,而来自最不严肃的娱乐活动——包括你昨晚那一局打得无比糟糕的游戏。

本文编译自WIRED。