GPT-6 Astra全面开放:$10/$50定价、百万token上下文与一场分阶段的算力卡位战

2026年9月3日,OpenAI正式发布GPT-6 Astra,并将其定位为“目前向公众部署的能力最强、对齐质量最高的模型”。两天后的9月5日,访问权限向ChatGPT Plus和Business订阅用户全面开放,同步重置了这两个层级的使用额度。API定价随之公开:标准输入每百万token $10,输出每百万token $50,较此前旗舰GPT-5.6 Sol的促销价格($4/$20)高出2.5倍。这是GPT-6名号首次出现在普通订阅用户的账户界面里。

需要立即说明的是,“全面开放”并不意味着一次性解锁全部功能。OpenAI采用了双轨访问机制:面向公众的标准版GPT-6 Astra在模型层面拒绝执行高级网络攻击任务;而涉及漏洞利用链构造等网络安全“关键”能力的版本,则通过名为Daybreak的受信访问计划单独分发给经审查的组织机构。公开模型与内部受控模型在能力上存在实质性差异,这是此次发布最容易被忽视的一条技术边界。

一个105万token上下文窗口意味着什么

GPT-6 Astra的上下文窗口为1,050,000 token,最大输出128,000 token,知识截止日期为2026年4月30日。这个数字在工程实践中的含义是:一次调用可以将约750万个英文单词(或约150万汉字)塞入同一个请求,相当于不分章节地读入整个代码库后再回答问题,而无需依赖外部检索或分段拼接。

配套更新的Codex获得了一项实验性的笔记保留功能——它能在上下文窗口结束后将关键信息显式保存,而非像以往那样将早期工作压缩进摘要。这解决了长期运行的coding agent丢失早期上下文细节的老问题。OpenAI表示该功能将“在未来数周内”成为Astra的默认行为。

模型以文本和图片作为输入,推理强度分为低、中、高、超高和最大五个档位,对应不同的计算消耗和响应速度。API还提供Fast模式,以两倍标准价格换取约2.5倍的任务完成速度,适合对延迟敏感但不在乎成本倍增的场景。

定价逻辑:每token贵了,每任务未必

$50/百万output token是当前公开模型市场的高位定价。但OpenAI给出了一个反驳框架:单token价格和单任务成本是两件事。如果GPT-6 Astra能以更少的token和更少的重试次数完成一项任务,总账单可能并不比Sol高。据Yotta Labs整理的数据,Astra在OSWorld 2.0计算机使用基准上以72.6%的准确率完成任务,比Sol的65.7%提升约10个百分点,且每任务耗时约少47%。

这个逻辑是否成立,取决于具体工作负载。对于简单的文本摘要或格式化任务,Sol的$4/$20定价仍有显著优势。但对于复杂的多步骤agent任务——例如跨多个工具的代码调试、长文档研究分析——Astra减少重试的收益更容易覆盖单价差距。OpenAI目前没有发布足够细粒度的任务级成本数据,上述推断在发布初期还无法用第三方数据直接验证。

此外,缓存机制提供了一条降低成本的路径:已缓存的输入token仅需$1/百万,是标准输入价格的十分之一。对于反复使用长系统提示的agent应用,这个价格差异在规模化部署后将形成实质性的账单优化空间。

计算机使用与软件工程:两个具体的能力支点

OpenAI将此次发布的重心明确落在两个方向:计算机使用(computer use)和软件工程。这不是泛化的能力声明,而是有具体基准数字支撑的定位。

在OpenAI自行发布的基准测试中,Astra在Terminal-Bench 4.0上得分57.9%,Sol为37.3%,提升超过20个百分点。DeepSWE v1.1(代码工程基准)上Astra为74.1%,Sol为72.7%,差距较小但仍领先。OSWorld 2.0(模拟真实桌面操作)上Astra 72.6%,Sol为65.7%。这三个基准共同指向一件事:模型操控软件界面、编写并执行代码、在复杂工具链中导航的实际能力有了可测量的提升。

幻觉率的变化同样值得单独关注。OpenAI报告Astra在其幻觉基准上的错误率为4.2%,而Sol为12.2%——这意味着在相同任务量下,Astra产生事实性错误的频率大约是Sol的三分之一。对于文档生成、法律或合规审查、研究摘要等容错率低的场景,这个数字的下降比任何能力基准都更直接地影响实际可用性。

网络安全方向的基准数字则更为极端:Astra在ExploitBench上得分100%,Sol为78.5%。正是这个数字导致了发布延迟——OpenAI在发布前数周公开表示因网络安全风险放缓了模型的推出节奏。最终的解决方案不是降低模型能力,而是通过Daybreak计划将高危能力限定在受审查的组织内。

多通道发布的产业逻辑

GPT-6 Astra的发布通道同时覆盖ChatGPT订阅(Plus/Pro/Business/Enterprise)、OpenAI API直接调用、Amazon Web Services Bedrock以及Microsoft Azure Foundry。这种多通道策略并非简单的铺货动作,它针对的是企业AI采购的三种典型路径:直接使用ChatGPT界面、通过API自建应用、通过现有云合同采购AI能力。

对于已经在AWS或Azure上有大规模云支出的企业,通过Bedrock或Azure Foundry使用Astra,意味着可以将AI费用并入现有云合同、利用既有的安全审查和合规框架,同时无需为OpenAI新开账户和走独立的数据处理协议流程。这降低了大型企业采购的摩擦系数,也是OpenAI与Anthropic、Google在企业端竞争的关键战场之一。

API可调用的model string为gpt-6-astra。对于已经在使用OpenAI API的开发团队,切换成本主要在于定价调整和可能需要重新校准的prompt,而非架构重写。Yotta Labs的分析指出,在多模型路由架构下,将Astra切入现有系统“只是一次配置变更”——这一说法的前提是团队已经采用了OpenAI兼容的接口标准,而非将业务逻辑硬绑在某个特定模型版本上。

与Sol的历史对照:这次能力跨越有多大

GPT-5.6 Sol是GPT-6 Astra的直接前代旗舰,两者的对比数据是目前最具参照价值的横向比较。从已公开的基准数字来看,最大的跳跃出现在两端:一是网络安全(ExploitBench 78.5%→100%),二是数学推理(FrontierMath Tier 4 83.0%→97.6%)。代码工程方向的提升相对温和(DeepSWE 72.7%→74.1%)。

这个分布意味着什么?数学和安全方向的极大提升,加上幻觉率的大幅下降,共同指向“推理可靠性”而非单纯的“能力天花板”方向。换句话说,Astra在“答对的概率”上的进步,可能比在“能做新事情”上的进步更为显著。对于企业用户,这个方向的改进往往比新功能更直接地影响实际部署决策——一个在95%的情况下答对的模型,和一个在60%情况下答对但能完成更复杂任务的模型,在生产环境中的使用策略完全不同。

下一步观察什么

以下判断基于现有信息的推断,而非已确认事实。

第一,API调用稳定性将是近期最关键的信号。大规模发布初期,模型服务的延迟、错误率和限速策略往往与基准测试阶段存在差距。开发者团队在正式将Astra纳入生产工作流之前,应在自己的实际任务分布上完成独立压测,而非仅依赖OpenAI发布的基准数字。

第二,Daybreak计划的准入边界将决定网络安全能力的实际可及范围。目前尚不清楚OpenAI如何界定“受信组织”的资格标准、审查周期和能力范围。这对安全研究机构和需要使用高级漏洞分析能力的企业而言,是实质性的不确定性。

第三,多模型成本路由将从可选策略变为工程刚需。在$10/$50的定价下,将全量请求无差别地打到Astra对大多数应用而言并不经济。按任务复杂度分层路由——简单任务走低成本模型、复杂任务走Astra——将成为控制AI成本的标准实践。能否精准识别任务复杂度,本身将成为新的工程挑战。

第四,Codex的笔记保留功能需要重点跟踪。如果这一功能在数周内如期转为默认,并且在实测中真正解决了长时间agent任务的上下文断层问题,它对coding agent类应用的影响将超过模型本身的能力数字——因为它改变的是整个工作会话的信息持久化方式,而不只是单次调用的质量。