豆包 Pro以95.52分居首:2026-10-01 Smoke快测数据简报

2026-10-01 赢政指数 Smoke 快测覆盖 15 个模型,豆包 Pro 以 95.52 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度,主榜公式为 0.55 × 代码执行 + 0.45 × 材料约束。由于每日样本量较小,单日分数更适合作为监控信号,而不是对模型能力做长期定论。

当日排名

排名模型主榜代码执行材料约束诚信
#1豆包 Pro95.5294.397pass
#2GPT-6 Sol89.569582.9pass
#3GPT-6 Astra88.579580.7pass
#4GPT-6.1 Sol88.579580.7pass
#5Grok 488.3910074.2pass
#6Claude Sonnet 4.687.899579.2pass
#7Claude Opus 4.786.2575100pass
#8GLM-4.6847595pass
#9DeepSeek V4 Pro81.257095pass
#10Gemini 3.1 Pro81.257095pass
#11GPT-o377.397580.3pass
#12Gemini 2.5 Pro77.167085.9pass
#13GPT-6 Luna77.167085.9pass
#14Qwen3 Max77.167085.9pass
#15GPT-5.570.255095pass

数据解读

从分数结构分析,豆包 Pro 以主榜 95.52 分领先,代码执行 94.3 分和材料约束 97 分形成均衡搭配。GPT-6 Sol 主榜 89.56 分,代码执行 95 分但材料约束 82.9 分。Grok 4 代码执行 100 分、材料约束 74.2 分,主榜 88.39 分。Claude Opus 4.7 则材料约束 100 分、代码执行 75 分,主榜 86.25 分。GLM-4.6 主榜 84 分,代码执行 75 分与材料约束 95 分的组合也较为突出。这些头部模型在代码执行与材料约束的强弱搭配上各有侧重。

与上一同口径 run 相比,GLM-4.6 主榜 +31.4 分,代码执行 +53 分,材料约束 +5 分。豆包 Pro 主榜 +25 分,代码执行 +22.3 分,材料约束 +28.3 分。DeepSeek V4 Pro 主榜 +24.2 分,代码执行 +48 分,材料约束 -5 分。Grok 4 主榜 +19.6 分,代码执行 +37 分。Gemini 2.5 Pro 主榜 +13.3 分,代码执行 +20 分,材料约束 +5 分。这些变化显示出单日测试中部分模型指标的明显起伏。

异常信号包括 Qwen3 Max 代码执行暴跌 -24 分以及 GPT-5.5 代码执行暴跌 -22 分。可能解释为题目抽样波动或真实退化,但需后续 run 复核。Smoke 是小样本单日信号,相关分析保持克制,不做长期结论。

主要变化

  • GLM-4.6:主榜上升31.4分,代码执行+53分,材料约束+5分
  • 豆包 Pro:主榜上升25分,代码执行+22.3分,材料约束+28.3分
  • DeepSeek V4 Pro:主榜上升24.2分,代码执行+48分,材料约束-5分
  • Grok 4:主榜上升19.6分,代码执行+37分
  • Gemini 2.5 Pro:主榜上升13.3分,代码执行+20分,材料约束+5分

需要关注的信号

  • Qwen3 Max:代码执行暴跌 -24 分
  • GPT-5.5:代码执行暴跌 -22 分

读这类 Smoke 简报时,重点应放在两个问题上:第一,某个模型是否连续多日暴露同一类弱点;第二,诚信评级是否从 pass 进入 warn 或 fail。单日执行或约束分数的大幅变化,可能来自题目抽样,也可能是真实退化的早期信号,需要后续 run 复核。


数据来源:赢政指数 (YZ Index) | Run #354 | 查看原始数据