2026-09-26 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 92.85 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度,主榜公式为 0.55 × 代码执行 + 0.45 × 材料约束。由于每日样本量较小,单日分数更适合作为监控信号,而不是对模型能力做长期定论。
当日排名
| 排名 | 模型 | 主榜 | 代码执行 | 材料约束 | 诚信 |
|---|---|---|---|---|---|
| #1 | 豆包 Pro | 92.85 | 98.7 | 85.7 | pass |
| #2 | GPT-5.5 | 91.32 | 100 | 80.7 | pass |
| #3 | Claude Opus 4.7 | 89.47 | 100 | 76.6 | pass |
| #4 | GPT-o3 | 87.22 | 100 | 71.6 | pass |
| #5 | Claude Sonnet 4.6 | 86.1 | 95.5 | 74.6 | pass |
| #6 | Gemini 2.5 Pro | 80.35 | 87.5 | 71.6 | pass |
| #7 | DeepSeek V4 Pro | 77.57 | 75 | 80.7 | pass |
| #8 | Qwen3 Max | 75.45 | 76.8 | 73.8 | pass |
| #9 | Gemini 3.1 Pro | 73.47 | 75 | 71.6 | pass |
| #10 | Grok 4 | 70.41 | 75 | 64.8 | pass |
数据解读
今日赢政指数Smoke快测中,豆包Pro以主榜92.85位居首位,其代码执行98.7与材料约束85.7的搭配显示出两者相对均衡的特点。GPT-5.5主榜91.32,代码执行100而材料约束80.7,同样依靠高代码执行得分维持靠前位置。Claude Opus 4.7主榜89.47、GPT-o3主榜87.22以及Claude Sonnet 4.6主榜86.1,均呈现代码执行100或95.5的高位,而材料约束分别停留在76.6、71.6与74.6区间,这种结构使它们在主榜公式0.55×代码执行+0.45×材料约束下获得领先。
与上一同口径run相比,Claude Sonnet 4.6主榜上升18.3分,主要来自代码执行增加45.5分但材料约束下降14.9分;豆包Pro主榜增加15.9分伴随代码执行上升32分;Qwen3 Max主榜增加15.2分、代码执行增加28.7分;GPT-o3主榜增加14.7分、代码执行增加50分而材料约束下降28.4分;Gemini 2.5 Pro主榜增加12.6分、代码执行增加37.5分而材料约束下降17.9分。这些变动可能源于单日题目抽样波动,也可能反映模型在材料约束维度的暂时表现差异,需后续run复核以确认信号稳定性。
Smoke快测作为小样本单日信号,上述分数结构与变化仅供当日观察,克制解读有助于避免过度推断模型整体状态。
主要变化
- Claude Sonnet 4.6:主榜上升18.3分,代码执行+45.5分,材料约束-14.9分
- 豆包 Pro:主榜上升15.9分,代码执行+32分
- Qwen3 Max:主榜上升15.2分,代码执行+28.7分
- GPT-o3:主榜上升14.7分,代码执行+50分,材料约束-28.4分
- Gemini 2.5 Pro:主榜上升12.6分,代码执行+37.5分,材料约束-17.9分
需要关注的信号
- 本次未保留可发布的异常信号。
读这类 Smoke 简报时,重点应放在两个问题上:第一,某个模型是否连续多日暴露同一类弱点;第二,诚信评级是否从 pass 进入 warn 或 fail。单日执行或约束分数的大幅变化,可能来自题目抽样,也可能是真实退化的早期信号,需要后续 run 复核。
数据来源:赢政指数 (YZ Index) | Run #339 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接