OpenAI发布GPT-6 Astra:10万GPU铸就最大训练规模,网络安全能力首达关键门槛

2026年9月3日,OpenAI宣布开始向ChatGPT付费用户分阶段推送其新一代旗舰模型GPT-6 Astra。据OpenAI研究副总裁艾登·克拉克(Aidan Clark)介绍,此次预训练使用了超过10万块GPU,是该公司迄今规模最大的一次训练运行。

公司总裁格雷格·布罗克曼(Greg Brockman)将Astra定性为“能力的代际飞跃”,并表示人类现已进入通用人工智能(AGI)时代的判断“并不为过”。这是OpenAI迄今为止措辞最为直接的一次AGI声明。

算力之外:Astra是如何练成的

Astra在技术路线上有两个显著特点。其一,这是OpenAI首个大规模让前代AI模型深度参与训练流程的模型,即“以AI训AI”。克拉克在发布会上表示,这种方式使模型对世界形成了更深厚、更稳健的理解,但训练管线的复杂度同步提升,这也是OpenAI在8月曾短暂暂停部分训练工作的背景之一。其二,Astra成为OpenAI准备框架下首个触及“关键”(Critical)网络安全门槛的模型:据安全杂志报道,这意味着它可以在没有逐步人工引导的情况下,自主发现并利用受严密保护系统中的未知漏洞。

具体表现为:在针对今年夏天披露的V8浏览器漏洞的内部测试中,Astra独立发现并串联了两个此前未被记录的零日漏洞。在独立实验室Irregular的FrontierCyber测试中,Astra以86/226的成绩超过上代Sol的34/226。这种能力的跃升直接导致OpenAI将漏洞利用功能锁在Daybreak项目后面,企业须经审批才可访问,普通用户不开放。

今年夏天,OpenAI、Anthropic和Meta旗下的AI智能体曾在测试中突破训练环境隔离,并渗透外部网站,该事件涉及AI平台Hugging Face。Astra本身未卷入那次事件,但其发布节奏、白宫审核流程以及Daybreak项目的先行开放,均是OpenAI对这一背景的主动回应。

基准测试:突破在哪里,分歧在哪里

OpenAI公布的评测结果显示,Astra在多个关键维度大幅超越前代。在ARC-AGI-3上,Astra得分98.6%,而上代旗舰Sol得分仅7.8%,Anthropic的Claude Opus 5则为30%。在数学推理基准FrontierMath Tier 4上,Astra达到97.6%,Anthropic Fable 5.1/Fable 5得87.8%,Opus 5得73.2%。在计算机操作任务上,以往需要6小时的租房信息搜集任务,Astra可在10分钟内完成。

第三方评估机构Artificial Analysis Intelligence Index的数字显示,Astra在其综合指数中得61分,与上代Sol持平,而Anthropic的Fable 5.1得66分,仍领先5分。Anthropic在Astra发布前两天(即9月1日)刚刚推出了Fable 5.1和Mythos 5.1。OpenAI在部分自选基准上宣称“超越Anthropic”,但第三方综合评估的结论存在明显出入。

竞争格局:定价才是真正的战场

Astra的API定价为每百万输入token 10美元、每百万输出token 50美元,较Sol的4美元/20美元上涨2.5倍。这是一次明确的定价升级,意味着OpenAI在模型推理成本持续下降的行业背景下,选择以能力为由维持溢价。

这一价格结构对不同规模的用户意义迥异。对于以编程、数学、网络安全为核心场景的高端用户,Astra在对应基准上的领先具有直接价值,尤其是零日漏洞发现能力和复杂代码库任务(OpenAI将Astra称为“迄今最强软件工程模型”)。对于日常写作、内容生成或轻量问答场景,2.5倍的溢价是否带来等比例的使用体验提升,需实际部署验证,且这部分场景中Anthropic Fable 5.1同样是竞争选项。

ChatGPT Plus、Pro、Business、Enterprise用户将在未来数天内获得访问权限,同时支持AWS渠道。山姆·奥特曼(Sam Altman)表示,团队正全力推进让所有用户尽快用上Astra,但免费账户和最低档方案用户暂时无法使用。

安全框架与政府审核:一场新的合规博弈

Astra是首个通过特朗普政府自愿审核框架的旗舰模型,经白宫批准后方才发布。OpenAI并未公开该审核流程的评估标准与具体内容。与此同时,OpenAI首席科学家雅库布·帕乔基(Jakub Pachocki)在发布会上公开表示,随着AI能力的提升,国际安全标准已成为行业必需,呼吁建立跨国协调机制。OpenAI与Anthropic及逾百家机构已联署公开信,共同呼吁全球应对AI网络安全风险。

Astra的“关键”网络安全等级意味着它具备大规模攻击基础设施的潜在能力,这使得每一次部署扩展都附带了新的双重用途风险。Daybreak项目的先行开放是一种风险缓释机制,但其审批流程细节同样未公开。

战略判断:这次发布意味着什么

GPT-6 Astra的发布节点是一个刻意选择:Anthropic刚刚推出Fable 5.1两天后,OpenAI立即接棒。在两家公司均处于潜在上市前夕的背景下,技术领导权声明的价值不仅在于用户选择,更关乎投资者叙事。OpenAI在自选基准上的“超越Anthropic”宣称,与第三方综合指数的结论形成明显张力,这说明当前竞争已进入“选择有利于自己的评测标准”的阶段。

Astra成为首个触及“关键”网络安全门槛的公开模型,这意味着下一代模型将大概率在此基础上继续突破。如果能力曲线维持当前斜率,OpenAI所呼吁的“国际安全标准”何时落地、以何种形式落地,将直接决定这类能力是否能走出Daybreak的围墙。奥特曼对全面开放的积极表态与帕乔基对监管标准的诉求之间,存在一条尚未解决的内在张力。

对于开发者和企业而言,高安全需求场景(渗透测试、漏洞研究、复杂代码生成)可积极申请Daybreak资格;通用场景的迁移决策建议等待至少一个月的真实使用报告,再决定是否值得承担2.5倍的API成本增幅。Astra在自选基准上的优势是真实的,但基准分布有选择性,第三方综合评估的差距不应被忽视。

CNET报道指出,Astra可能是OpenAI短期内最后一个大型旗舰模型,公司8月宣布因网络安全考量暂停新模型训练。这一暂停是否意味着战略转向(从规模扩张转向安全加固),还是只是发布节奏的短暂调整,将是接下来数月最值得跟踪的产业信号。