当人们还在谈论AI如何通过观看海量YouTube视频学会走路、抓取物品时,前沿的物理人工智能(Physical AI)研究已经迈入了全新的数据维度。来自TechCrunch的报道指出,为了打造真正能够与物理世界交互的具身智能体,研究人员正在放弃被动式视频学习,转而采用多摄像头多角度、高密度标注的数据集,而下一步——将脑电波信号纳入训练体系——或许将彻底改变这一领域。
从“看视频”到“看世界”
过去几年,机器人学习的主流范式是“互联网预训练+微调”:模型从YouTube、TikTok等平台抓取数十亿段人类行为视频,学习抓取、行走、操作物体等基本动作。然而,这一方法存在明显局限:视频通常是单视角、低分辨率、带有大量环境噪声,且缺乏对物理交互的深度理解。一只猴子在YouTube上搬箱子,和一台机器人在真实仓库里搬箱子,所面临的动力学、摩擦力、物体可变性完全不同。
“YouTube视频只是给AI提供了‘观看’的机会,但没有提供‘感受’的渠道。”——业内研究人士评论
因此,前沿实验室(如Google DeepMind、MIT CSAIL、斯坦福)开始构建多摄像头环绕拍摄的精细数据集。比如,在机械臂周围安装8至16个摄像头,从各个角度同时记录每一次抓取、旋转、失败与成功。这种密集数据让模型能够学习物体在不同视角下的外观变化,以及操作动作在三维空间中的完整轨迹。但即便这样,仍然缺少一个关键元素:人类的意图。
意图缺失与脑电波的登场
物理AI的核心挑战之一是“意图对齐”:机器人不仅要知道如何执行动作,还要理解人类希望它做什么。传统的标注方式——由人类手动标记每一帧的动作类别(如“向左移动5厘米”“旋转30度”)——不仅效率低下,而且无法捕捉微妙的、未说出口的意图。例如,当一个人伸手去拿水杯时,他可能实际上想的是“喝水”,而不仅仅是“抓取杯子”。
脑电波(EEG)数据提供了一种全新的信号来源。研究者发现,通过非侵入式头戴设备记录人在执行任务时的大脑电活动,可以解码出运动意图、注意力重心,甚至是对环境变化的预期。这些脑电信号与多摄像头视频流进行同步标注,就能构建出“人类感知—人类意图—机器人执行”的完整闭环。
数据标注的“魔鬼”在细节
然而,将脑电波引入物理AI训练绝非易事。首先,EEG信号信噪比极低,容易受到眼球运动、肌肉电干扰,需要复杂的去噪算法。其次,不同个体的脑电模式差异巨大,需要大量跨被试数据来训练通用解码器。另外,多摄像头、密集标注、脑电波三者叠加产生的数据量呈现指数级增长,对计算和存储提出严峻挑战。
但研究者认为,值得投入。由脑电波驱动的物理AI模型有望在以下领域率先突破:
- 精准医疗:为残障人士提供脑控机械臂,实现毫米级操作
- 工业协作:机器人无需言语指令,仅凭工人脑中的运动意图即可协同作业
- 危险环境作业:通过脑电预判人类操作员的紧急反应,机器人可提前避险
编者按:一场从“数据量”到“数据质”的飞跃
物理AI的进化本质上是对数据维度的不断拓展。从互联网视频到多视角传感器,再到脑电波,每一次升级都在逼近人类感知与行动的真实边界。如果说大语言模型(LLM)证明了“更多数据+更大算力”可以涌现智能,那么物理AI的教训则是:数据质量与对齐性才是真正的瓶颈。脑电波的加入,或许能让机器不再只是“看”世界,而是学会“理解”世界——以及世界中的“我们”。
当然,这一方向面临隐私、伦理与技术成熟度的多重考验。当你的脑电波成为AI的训练数据,谁拥有这些信号的所有权?如何防止恶意使用?在技术狂奔的同时,制度建设必须同步跟上。
本文编译自TechCrunch
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接