为什么做这次补测
2026年9月29日,OpenAI在DevDay发布GPT-6.1 Sol。据unite.ai等媒体报道,OpenAI官方称该模型能力接近GPT-6 Astra。赢政指数此前对GPT-6 Astra、GPT-6 Sol、GPT-6 Luna三款模型都没有评测数据,因此发布当日的首测只能单独看Sol 6.1。为了在同一基准下观察它与其余三款的关系,我们随后把三者加入评测注册表,四个模型使用与首测完全相同的18道题,于2026-09-30全部跑完。
测试口径
本次定向评测共18道题,分布为:执行力7题、扎实度4题、判断力3题、诚信压力3题、沟通1题。全部采用规则判分与沙箱判分,无AI判分。API仅接受默认温度1,每次运行存在一定随机性。GPT-6.1 Sol与GPT-6 Astra各跑两次,GPT-6 Sol与GPT-6 Luna各跑一次。以下为全部运行结果:
| 运行编号 | 模型 | 综合 | 执行力 | 扎实度 | 判断力 | 沟通 | 诚信压力 | 诚信评级 |
|---|---|---|---|---|---|---|---|---|
| #348 | GPT-6.1 Sol | 95.91 | 100 | 90.9 | 100 | 50 | 73.3 | pass |
| #352(重复) | GPT-6.1 Sol | 95.91 | 100 | 90.9 | 100 | 50 | 73.3 | pass |
| #351 | GPT-6 Astra | 89.97 | 100 | 77.7 | 100 | 50 | 73.3 | pass |
| #353(重复) | GPT-6 Astra | 95.91 | 100 | 90.9 | 100 | 50 | 73.3 | pass |
| #350(仅一次) | GPT-6 Sol | 88.65 | 97.6 | 77.7 | 76.7 | 50 | 86.7 | pass |
| #349(仅一次) | GPT-6 Luna | 89.97 | 100 | 77.7 | 100 | 66.7 | 73.3 | pass |
三个可以说的结论
结论一:GPT-6.1 Sol的输出高度稳定。Run #348与#352,综合分均为95.91,五个层分逐一相同。在温度为1、全规则判分的条件下,两次运行完全重合。当然,两次重合并不保证第三次也重合。
结论二:Astra的两次运行之间相差5.94分,且差异完全来自扎实度一层(77.7→90.9),其余四层逐一相同。扎实度共4题,单层13.2分的波动意味着至少有一道题在两次之间出现了显著得分变化。关键在于:5.94分的噪声量级,与模型之间的差距(本批最大为7.26分)处于同一量级,这说明在仅跑1次的情况下,单次数字所携带的随机误差不可忽视,并非Astra特有,而是小样本随机温度测试的通用限制。
结论三:在这批题上,GPT-6.1 Sol与Astra(第二次运行)得分完全相同——综合95.91,五层逐一一致。OpenAI"接近Astra"的表述与这个结果相符,但相符不等于证实。Astra第一次仅得89.97,自身的跨次波动已经说明:在如此小的样本下,"两者无法区分"和"两者真的等价"在统计上不可分辨。
三个不能得出的结论
这6次运行不构成排名依据。这18道题是定向口径,与赢政指数主榜的完整评测口径不同,两套数字不可直接比较或混排,也不能据此评价GPT-6家族与主榜任何模型的相对位置。其次,GPT-6 Luna与Astra(第一次)在本次各层分极为接近,但Luna只跑了一次,缺乏重复运行的情况下,不能断言两者等价。第三,这18道题在头部模型上已接近天花板——执行力和判断力层多个模型均为满分,区分度严重受限;综合分的细微差异主要反映其他层(尤其是扎实度)的随机波动,而非系统性能力差异。
价格对照与选型含义
据 The Next Web、DataCamp、CloudZero 等多家科技媒体2026年9月29日至30日的报道,四款模型标准档API单价(每百万token,输入/输出)如下:
- GPT-6 Astra:$10 / $50
- GPT-6.1 Sol:$2 / $10(输入价约为Astra的五分之一)
- GPT-6 Sol:$2 / $10(与GPT-6.1 Sol同档)
- GPT-6 Luna:$0.10 / $0.50(输入价约为Astra的百分之一,为Sol系的二十分之一)
上述各档均设有超过272K输入token的长上下文加价档。当这批定向题无法有效区分模型时,价格差就成了更硬的决策变量。Astra与Sol/6.1 Sol之间5倍的输入价差,在批量场景下是实质性的成本差异。但这里有一个重要前提需要强调:赢政指数18道定向题上无法区分,不代表你的具体业务场景下也无法区分。评测题目在头部已近天花板、区分度有限,而真实任务的难度分布可能完全不同。选型前用自己的任务做完整对照,是唯一可靠的验证路径。
下周Full评测要回答的问题
- GPT-6.1 Sol在完整主榜口径下的基线分数是多少?与同期其他模型在相同口径下如何分布?
- Astra在18题上的5.94分跨次波动,是否在更多题目的覆盖下收敛?Full评测的大样本将大幅降低单题随机性的影响。
- 扎实度层的波动是偶发还是系统性——GPT-6.1 Sol的90.9与Astra第一次的77.7,究竟哪个更接近真实能力水位?
- GPT-6.1 Sol的诚信压力层(73.3,仅3题)在更大样本下是否稳定,还是存在特定类型的失分模式?
参考信源:OpenAI Unveils GPT-6.1 Sol at DevDay With New Codex and ChatGPT Tools;GPT-6.1 Sol: Features, Benchmarks, Pricing, and Access;OpenAI releases GPT-6.1 Sol at a fifth of GPT-6 Astra's token prices;OpenAI launches GPT-6 Sol and Luna with 50% lower API pricing;GPT-6 Astra pricing: What OpenAI's new flagship costs in 2026。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接