OpenAI将Astra列为首个关键网络安全模型 安全管控与可用性平衡引争议

2026年8月,OpenAI正式将即将推出的Astra模型列为公司Preparedness Framework下的首个critical网络安全模型。这一决定源于内部与专家评估显示,Astra在智能体编程和网络安全领域达到该框架定义的最高风险阈值。

模型能力触发最高风险阈值

根据OpenAI公开材料,critical级别意味着模型可能在无需人类干预的情况下挖掘零日漏洞,或仅凭高层级战略目标自主实施端到端网络攻击。Astra的评估结果触发了这一门槛,导致公司暂停部分尚未满足强化安全标准的内部活动。

我们正在全力推进它的公开发布。我们始终认为,把顶尖模型局限在少数人手里并不是个好策略。不过鉴于它在网络安全方面的强大能力,我们还需要一点时间来确保万无一失。——Sam Altman

公司已采取多项具体措施,包括设置隔离测试环境、限制网络与工具访问权限、强化模型权重保护与加密、部署额外监控与检测能力,以及实施沙箱化运行。同时对所有智能体应用实施全局监控,通过思维链审查拦截高风险操作。

治理决策的实际含义

这一分类并非简单宣称Astra将更好帮助防御者,而是关于管理前沿模型的治理决定。OpenAI将网络安全能力作为Preparedness Framework的核心风险领域,Astra的处理方式显示,性能评估 alone 不足以判断系统是否适合特定环境。企业用户需关注访问权限、工作流支持和监督要求可能受到影响。

第三方报道指出,Astra内部评估引发对critical网络安全能力的担忧,促使OpenAI在加强保障措施前暂停某些活动。公开信息未详细说明每项控制、模型具体能力和未来可用性条件。

企业采用的现实考量

对企业而言,Astra的critical指定凸显前沿AI采用的一个趋势:单纯性能评估可能不够。网络安全能力会影响谁能获得访问、支持哪些工作流以及需要哪些监督。OpenAI同时描述了防御工具开发和可信网络安全专业人士访问计划,但未指定Astra最终访问模式。

独立判断

从事实看,OpenAI的行动显示其Preparedness Framework正在从框架转向实际执行,critical级模型的额外控制措施已开始影响开发节奏。这表明安全合规要求可能延长从评估到部署的时间,但同时保持了向广泛用户开放的路径。企业应关注后续第三方测试结果和访问政策更新,以评估实际部署可行性。