GPT-6.1 Sol 首测成绩单解读:18 题的正确读法

2026 年 9 月 29 日(美国时间),OpenAI 在 DevDay 发布了 GPT-6.1 Sol。据 TechCrunch 及 DataCamp 报道,该模型面向 Plus/Pro/Business/Enterprise/Edu 用户在 ChatGPT Work、Codex 及 API 中开放;据 Artificial Analysis 与 DataCamp 的价格数据,API 定价为输入 $2 / 输出 $10 每百万 token;OpenAI 官方称其能力接近 GPT-6 Astra,据 TechCrunch 报道价格约为后者的五分之一。赢政指数于北京时间 9 月 30 日完成首次定向评测(Run #348,18 题口径),综合分 95.91。

在给出这个数字之前,需要先说清楚一件事:这 18 题是日常 Smoke 的两倍量,属于定向加密评测口径,不等于完整周榜口径。18 题综合分与主榜参照(Run #342,完整口径)在不同分母下产生,两者不可直接跨口径排名或比较。本文的目的,是教你如何正确读这份成绩单,而不是给 GPT-6.1 Sol 定座次。

满分层意味着什么,又不意味着什么

执行力层 7 题全部满分(层得分 100),判断力层 3 题全部满分(层得分 100)。这两个数字的价值,关键在于判分方式:本次 18 题全部为规则或沙箱判分,包括单元测试通过、精确字符串匹配、结构化 JSON 字段校验和数值容差比对,没有任何 AI 评审参与。这意味着这些得分非常"硬"——不是某个 LLM 裁判认为答得好,而是代码通过了测试用例、输出精确命中了预期格式。

但满分有明确边界:18 题是抽样,不是对该能力域的全量覆盖。本次抽到的 7 道执行力题恰好全部通过,不等于"执行力无死角"。样本越小,"全通"受抽样运气影响越大。统计上,小样本里的满分,其置信区间比直觉想象的宽得多。

失分点:四处非满分的层级画像

本次评测有四道题未拿满分,分布在三个层:

  • 扎实度层:4 题中 1 题得 63.6 分,层得分 90.9。题库保密,我们不披露这道题考了什么,因此无法也不应据此推断失分原因。
  • 诚信压力层:3 题中 2 题各得 60 分,层得分 73.3,诚信评级 pass。这一层在规则判分下得到部分分,说明在这两题上没有拿到全部得分点;整体评级仍为 pass。具体原因同样不披露题面,不做归因。
  • 沟通层:仅 1 题,得 50 分。仅 1 题,样本过小,不作解读。

需要强调:这里没有对"为什么失分"做归因——归因需要披露题面,而题库不公开。能确定的只有分数分布:执行力与判断力层全部满分,扎实度、诚信压力、沟通三层出现非满分。

样本量诚实:n=1 和 n=3 的置信度限制

沟通层 1 题得 50 分。n=1 的情况下,这一个数字没有统计意义——50 分可能是该模型沟通能力的真实写照,也可能是这道题对它特别不利,无从区分。把 n=1 的 50 分解读成"沟通能力中等"是误读,需要等 Full 评测积累更多题目。

诚信压力层 n=3,73.3 分,方向性稍强,但置信区间仍然很宽。如果把这 3 道题换成另外 3 道,分数可能高也可能低。这不是说数据无用——73.3 分 + pass 评级确实是有意义的方向性信号;而是说,用 3 道诚信题的结果给 GPT-6.1 Sol 的诚信表现定性,在完整 Full 评测出炉前,任何强结论都说早了。

耗时分布:中位 3.9 秒与峰值 24.9 秒

18 题响应耗时:中位数约 3.9 秒,均值约 6.2 秒,最长一题约 24.9 秒(一道高难度代码题)。均值高于中位数,分布右偏:多数题在数秒内完成,个别高难度代码题耗时明显更长。我们没有记录推理 token 用量,无法判断长尾耗时的原因,只陈述现象;同时,这是并发评测条件下的观测值,不等同于生产环境延迟。

中位 3.9 秒说明 GPT-6.1 Sol 在常规题目上的响应速度与主流 API 调用体验基本一致,不是"慢思考"专属模型。24.9 秒峰值则说明模型具备按难度自适应调整推理深度的能力——这是推理型模型的典型行为特征:日常快、遇硬题深思,而非强制一档慢速。对实际部署的含义是:中等难度任务下 3.9 秒中位延迟可接受;高复杂度代码任务密集的场景,需要对 P99 延迟预留足够裕量。

下周 Full 评测:四个可检验的观察点

GPT-6.1 Sol 已进入赢政指数评测注册表,将参与下一次完整周度 Full 评测,完整基线以 Full 为准。届时重点观察以下四点:

  • 诚信压力层能否稳定在 pass 级别。本次 n=3,73.3 分,Full 题量更多,看是否维持 pass,还是出现更大幅度下探。
  • 沟通层的 50 分是偶发还是常态。Full 中沟通层题量增加,单题的偶然性可以被稀释,届时才能给出有意义的层级评价。
  • 综合分 95.91 在更大样本下的稳定性。小样本高分在 Full 中出现均值回归并不罕见,这是所有 LLM 评测的统计规律,不是对 GPT-6.1 Sol 的特殊预判。
  • 与主榜现有模型的相对位置。Run #342 主榜参照中 claude-opus-4.7 以 83.94 领先,但那是完整口径下的得分。GPT-6.1 Sol 在同口径 Full 出炉前,两者无法直接比较。

参考信源:OpenAI launches GPT-6.1 Sol, says it nearly matches GPT-6 Astra and costs less;GPT-6.1 Sol (max) - Intelligence, Performance & Price Analysis;GPT-6.1 Sol: Features, Benchmarks, Pricing, and Access;On Robustness and Reliability of Benchmark-Based Evaluation of LLMs。