OpenAI开发“持久”AI代理,Codex可工作到被暂停

OpenAI开发“持久”AI代理,Codex可工作到被暂停

WIRED通过审阅代码发现,OpenAI正在开发一项极具野心的功能:让Codex成为“持久”运行的AI代理。所谓“持久”,意味着Codex不会在完成一次对话或单次任务后停止,而是可以持续地在后台工作,主动推进开发流程,直到人类用户明确将其“送入休眠”状态。

“WIRED审阅的代码显示,这家公司正在开发一项功能,使Codex能够主动持续工作,直到被‘置于休眠状态’。”

Codex:从编码助手到自主“程序员”

Codex最初是OpenAI面向开发者推出的编程代理。它不仅能生成代码片段,还能在终端中执行命令、解析代码库、编写测试和修复缺陷。与单纯的生成式AI不同,Codex具备一定的“行动能力”,可以调用工具去影响外部环境。如今,OpenAI打算进一步放开它的“手脚”,让它在更长时间里自主运作。

可以设想,持久化模式的典型场景是:工程师在早上向Codex布置一个泛化任务,比如“优化数据库查询性能”,然后Codex会自主分析系统负载、定位瓶颈、编写补丁、运行基准测试,并在下午给出报告。整个过程中,工程师无需一步步指导,只需在最后审查结果。

“持久”意味着什么?

现代AI代理大多采用“强化学习+工具调用”的架构,每一步都需要模型进行决策并执行动作。持久化代理的关键差异在于,它不受单次上下文的限制,能够跨会话保留状态和长期目标。这种设计需要更复杂的规划、记忆和错误恢复能力。否则,代理可能会在长时间运行中陷入死循环或偏离任务目标。

代码中出现的“sleep”机制暗示,用户可以通过类似睡眠的指令让代理暂停。这表示OpenAI意识到,持续运行的代理必须提供可靠的中断和恢复机制。然而,如何确保代理在“醒来”后仍记得先前的进度和约束,是尚未公开的技术难题。

硅谷竞赛:人人都想要“不眠员工”

OpenAI不是唯一追逐这一方向的公司。Anthropic的Claude最近扩展了“代理式”编码能力;Google的Gemini也支持长时间任务规划;创业公司Cognition AI推出的Devin,更是以“全自主软件工程师”为卖点。但多数产品仍停留在“短回合”的交互模式,一旦任务步骤过多,模型就会迷失。真正能做到“持久”运行并可靠交付的产品,目前仍然稀缺。

如果OpenAI率先落地这一功能,它将获得显著的竞争优势。毕竟,软件开发的“夜班工人”价值巨大:服务器可以24小时跑,IDE也可以24小时开,只有人类程序员需要睡觉。AI代理的“不眠不休”,可能让项目交付速度提升一个量级。

效率与安全:持久代理的双刃剑

从DevOps到自动化测试,持久代理的潜力覆盖整个软件生命周期。但对于长时间无人监督的运行,任何微小的偏差都可能被放大。因此,“休眠”机制只是基础,更关键的是代理需要具备自我验证和不确定性处理能力。OpenAI是否为此设计了新的安全层,是WIRED报道中留给读者的悬念。

目前OpenAI尚未对该功能发表公开评论。但这一功能的开发方向已经十分清晰:AI代理正在从“回答问题”走向“替人类完成工作”。

编者按:持久化AI代理是通往“自主智能体”的重要一步,但也是一次危险的跳跃。如果AI不能正确判断何时该停下,那么“不眠不休”就不再是优点,而是风险。

在追求效率的同时,我们必须正视几个关键问题:持久代理的每一步行为如何被审计?它是否有能力拒绝那些看似合法却有害的指令?一旦代理因为长时间运行产生错误,导致代码库出现严重故障,责任该如何界定?这些问题没有答案之前,任何“持久化”的功能都更像是一场对可靠性的极限压力测试。

OpenAI选择在Codex上迈出这一步,或许是因为编程任务天然拥有较高的可验证性——代码可以通过测试和审查来确认结果。但即便如此,“持久”代理仍然需要人类监督的“安全网”。我们期待它带来生产力的革命,但也应在“休眠”按钮之外,设置更多的护栏。

本文编译自WIRED