谷歌Gemini Robotics 2:AI从数字走向物理世界

谷歌Gemini Robotics 2:AI从数字走向物理世界

AI的“出柜”:从数字大脑到物理身体

日前,Google DeepMind推出了重磅迭代——Gemini Robotics 2,将AI的能力从虚拟桌面延伸到真实的物理世界。这不再仅仅是聊天机器人或图像生成器,而是一个能够感知、理解并操纵现实环境的“智能体”。在演示中,机器人手臂可以在杂乱桌面精准抓取不同形状物体,甚至执行如折叠衣物、使用工具等精细动作。这一跃升被DeepMind研究者称为“物理AGI”的开端——即能像人类一样在物理世界中泛化学习和操作的人工智能。

技术根基:Gemini多模态模型的实体化

Gemini Robotics 2的核心是此前发布的Gemini多模态大模型,但经过了针对物理交互的深度微调。模型接受视觉、触觉、语言等多种输入,输出动作指令、抓取策略和路径规划。相比前代,它在理解三维空间、物体物理属性和实时反馈方面有显著提升。通过大规模模拟训练(Sim-to-Real)和少量真实数据,模型能快速适应陌生场景——即便从未见过的工具,也能在几次尝试后学会正确使用。

“物理AGI”的承诺与未完之路

业界长期争议AGI(通用人工智能)是否必须在物理世界中得以体现。传统AI在文字、图像上表现惊艳,但一旦需要真正“动手”就捉襟见肘。Gemini Robotics 2证明:当大语言模型与强化学习、机器人控制深度融合时,AI可以初步展现出类人的物理常识和操作能力。例如,它知道杯子是易碎的,拿起时力度要轻;它也能理解“把螺丝刀递给旁边的人”这一社会性指令。这种对物理世界和人类意图的整合,被认为是通往AGI的关键台阶。

“这不仅仅是机器人技术的进步,更是AI理解世界方式的根本转变。”——WIRED科技编辑Will Knight

风险如影随形:真实世界中的AI问题

然而,将AI放入现实世界也伴随着巨大的安全隐患。首先,物理AI一旦出现“幻觉”,后果可能不再是恶意文本,而是实际破坏——比如撞翻花瓶、误伤人类。其次,滥用风险升级:若此类模型被用于自主武器系统或非法侵入设施,后果不堪设想。此外,数据隐私和保护问题更为紧迫——机器人摄像头可360度记录家庭、工厂内的人与物。Google DeepMind在论文中明确表示,目前Gemini Robotics 2尚处于研究阶段,需配合严格的安全外壳(如力矩限制、急停开关)和社会监管框架才能部署。

编者按:AI触达物理世界,人类准备好了吗?

当AI真正长出“手”和“脚”,我们面临的远不只是技术挑战。伦理、法律、就业结构都将迎来重塑。Gemini Robotics 2的发布提醒我们:在追求AGI的路上,不能只关注智力,更要为它穿上铠甲。否则,一次失误就可能让人们对AI的信任崩塌。未来十年,物理世界与数字智能的融合将加速到来,而风险管控的优先级或许应高于功能堆叠。

本文编译自WIRED