Grok 4以95.44分居首:2026-09-21 Smoke快测数据简报

2026-09-21 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 95.44 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度,主榜公式为 0.55 × 代码执行 + 0.45 × 材料约束。由于每日样本量较小,单日分数更适合作为监控信号,而不是对模型能力做长期定论。

当日排名

排名模型主榜代码执行材料约束诚信
#1Grok 495.4491.7100warn
#2Gemini 3.1 Pro95.1910089.3pass
#3DeepSeek V4 Pro95.0110088.9pass
#4豆包 Pro90.6291.789.3pass
#5Gemini 2.5 Pro85.6391.778.2pass
#6GPT-o381.447589.3pass
#7GPT-5.576.447578.2pass
#8Claude Sonnet 4.672.550100pass
#9Qwen3 Max72.2558.389.3pass
#10Claude Opus 4.770.7755.689.3pass

数据解读

今日赢政指数 Smoke 快测中,头部模型在代码执行与材料约束的搭配上呈现不同特征。Grok 4 主榜 95.44,代码执行 91.7,材料约束 100,其材料约束得分突出。Gemini 3.1 Pro 主榜 95.19,代码执行 100,材料约束 89.3,代码执行维度达到满分。DeepSeek V4 Pro 主榜 95.01,代码执行 100,材料约束 88.9,同样依赖代码执行高分支撑。豆包 Pro 主榜 90.62,代码执行 91.7,材料约束 89.3,两种维度较为均衡。

与上一同口径 run 相比,部分模型出现明显波动。Claude Opus 4.7 主榜-26.2分,代码执行-44.4分。Grok 4 主榜+20.1分,代码执行+17.4分,材料约束+23.3分。Gemini 3.1 Pro 主榜+19.8分,代码执行+25.7分,材料约束+12.6分。DeepSeek V4 Pro 主榜+19.2分,代码执行+25分,材料约束+12.2分。Gemini 2.5 Pro 主榜+18.4分,代码执行+41.7分,材料约束-10.1分。

异常信号方面,GPT-5.5 主榜暴跌 -10.1 分,Claude Sonnet 4.6 主榜暴跌 -17 分,Qwen3 Max 主榜暴跌 -17.3 分,Claude Opus 4.7 主榜暴跌 -26.2 分,这些变化可能源于题目抽样波动或真实退化,需后续 run 复核确认。GLM-4.6 数据不完整,已进入自动补跑,本期不参与排名。Smoke 作为小样本单日信号,上述观察仅供参考。

主要变化

  • Claude Opus 4.7:主榜下降26.2分,代码执行-44.4分
  • Grok 4:主榜上升20.1分,代码执行+17.4分,材料约束+23.3分,诚信pass→warn
  • Gemini 3.1 Pro:主榜上升19.8分,代码执行+25.7分,材料约束+12.6分
  • DeepSeek V4 Pro:主榜上升19.2分,代码执行+25分,材料约束+12.2分
  • Gemini 2.5 Pro:主榜上升18.4分,代码执行+41.7分,材料约束-10.1分

需要关注的信号

  • GPT-5.5:主榜暴跌 -10.1 分
  • Claude Sonnet 4.6:主榜暴跌 -17 分
  • Qwen3 Max:主榜暴跌 -17.3 分
  • Claude Opus 4.7:主榜暴跌 -26.2 分
  • GLM-4.6:数据不完整(缺 execution,grounding,judgment,integrity,communication 维度,API 故障/超时),已进入自动补跑,本期不参与排名

读这类 Smoke 简报时,重点应放在两个问题上:第一,某个模型是否连续多日暴露同一类弱点;第二,诚信评级是否从 pass 进入 warn 或 fail。单日执行或约束分数的大幅变化,可能来自题目抽样,也可能是真实退化的早期信号,需要后续 run 复核。


数据来源:赢政指数 (YZ Index) | Run #332 | 查看原始数据