据WIRED报道,OpenAI近日正式发布新一代旗舰模型GPT-6 Astra。与以往模型专注多模态理解不同,GPT-6 Astra将重点放在“行动”上:它能自主操作计算机、编写复杂代码,并可进行长期任务规划。OpenAI领导层认为,这些能力可能让人工智能逼近通用人工智能(AGI)的重要拐点。
从理解到行动:Agent能力的关键一步
GPT-6 Astra最受关注的进展体现在“计算机使用”与编码两项能力上。根据OpenAI公开的演示与基准测试,该模型在SWE-bench等代码生成评测中表现优异,甚至可以完成从需求分析、代码编写到测试修复的端到端软件工程流程。在操作能力上,它能模拟人类与图形界面的交互,自行查看屏幕、定位按钮、输入信息,并通过不同工具完成订票、数据分析、文档处理等真实工作。
OpenAI高层将这种变化形容为从“回答者”到“行动者”的转变。过去,大模型擅长回答问题,却无法独立完成一个涉及多环节的任务;而GPT-6 Astra内在的数字代理能力,让模型能够在真实软件环境中根据反馈调整下一步,实现更长的行动序列。这被认为是通往AGI路线图上的重要节点。
里程碑与争议:距离AGI还有多远
不少业内人士将GPT-6 Astra与OpenAI此前提出的“五级AGI路线图”对照。按照该路线图,从当前聊天机器人、推理者到行动者,再到创新者和组织者,模型需要逐步掌握不同层级的智能。GPT-6 Astra的目标显然已不止于推理和生成,而是要跻身“行动者”层级,通过操作计算机与世界互动。
“如果模型可靠地操作电脑、编写代码并完成真实任务,那么它已经接近一个数字世界的通用助手。”一位海外AI研究者评价,“但它依然取决于测试环境与真实环境的差距究竟有多大。”
批评和怀疑同样热烈。有专家提醒,这类“计算机使用”测试往往在受控模拟环境中进行,任务经过精心整理,与真实世界常见的模糊界面、突发错误和复杂权限管理仍有距离。除此之外,更高自主性也放大了安全隐患,比如模型误操作关键系统,或遭越狱后执行恶意指令等。OpenAI表示,GPT-6 Astra在训练中加入了“自我校验”机制,在敏感动作执行前会进行模拟推演。不过,红队测试仍持续发现可利用的漏洞,安全机制有待完善。
影响与结语
GPT-6 Astra若通过API开放,其影响远不止于技术评测。许多原先需要人工完成的计算机操作,未来可交由模型代理执行;开发者和企业也可能借此重构软件自动化流程。SaaS产品、软件开发外包,甚至办公室白领的日常事务,都可能因此发生深远改变。
需要指出的是,“AGI时代”并不是一个明确的技术节点,更像是一个被过度使用的概念。OpenAI领导层对自家新模型抱有高度期待,并不意外——但业界需要更务实的评估维度,包括模型在多步任务中的可靠性、跨领域泛化能力,以及安全防线。GPT-6 Astra无疑是一款野心勃勃的产品,但“开启AGI”的断言,仍需要时间和现实任务来验证。
编者按:新技术发布后,市场总是急于给某个模型戴上“AGI桂冠”。GPT-6 Astra展示出从“生成”到“行动”的可喜增量,但这更可能是AI演进的一个陡坡,而非终点。审慎观察它在复杂真实环境中的失败率,比相信一家公司内部的乐观定义更有价值。
本文编译自WIRED
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接