基準: Run #323 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-09-14 05:06 SGT 最新: Run #333 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-09-21 05:05 SGT

主变动 综合力 core_overall

Gemini 2.5 Pro +6.6
65.3 → 71.9
GPT-o3 +4.7
76.6 → 81.3
Qwen3 Max +3.3
70.0 → 73.3
Claude Opus 4.7 +2.8
80.1 → 82.8
Gemini 3.1 Pro +1.8
70.7 → 72.5
Claude Sonnet 4.6 +0.5
76.8 → 77.3
Grok 4 -1.4
79.6 → 78.2
GPT-5.5 -1.4
77.8 → 76.4
豆包 Pro -1.0
72.0 → 71.0
1 个模型保持稳定
DeepSeek V4 Pro (69.4)

侧面排行榜变动 工程判断 / 任务表达

豆包 Pro +7.5
任务表达: 85.8 → 93.3
Claude Sonnet 4.6 +7.0
任务表达: 80.4 → 87.4
Claude Opus 4.7 +4.4
工程判断: 82.8 → 87.2
Claude Sonnet 4.6 +3.8
工程判断: 79.8 → 83.6
Qwen3 Max +2.5
任务表达: 47.8 → 50.3
GPT-5.5 +2.2
工程判断: 87.8 → 90.0
Grok 4 +2.1
任务表达: 85.8 → 87.9
Gemini 2.5 Pro -15.0
任务表达: 80.8 → 65.8
Gemini 2.5 Pro -13.2
工程判断: 76.5 → 63.3
Gemini 3.1 Pro -10.0
工程判断: 87.8 → 77.8
DeepSeek V4 Pro -5.0
工程判断: 82.8 → 77.8
Grok 4 -4.7
工程判断: 60.3 → 55.6
DeepSeek V4 Pro -2.7
任务表达: 76.3 → 73.6
Claude Opus 4.7 -2.5
任务表达: 72.8 → 70.3
GPT-o3 -2.5
任务表达: 80.8 → 78.3
GPT-o3 -0.6
工程判断: 83.0 → 82.4
Qwen3 Max -0.6
工程判断: 40.6 → 40.0

运营信号变动 稳定性 / 可用性 / 性价比

Gemini 2.5 Pro +6.3
稳定性: 28.9 → 35.2
GPT-o3 +5.2
稳定性: 32.1 → 37.3
Claude Opus 4.7 +4.6
稳定性: 34.9 → 39.5
Claude Sonnet 4.6 +3.7
稳定性: 33.0 → 36.7
Gemini 3.1 Pro +2.2
稳定性: 26.1 → 28.3
Gemini 2.5 Pro +1.7
性价比: 34.6 → 36.3
Qwen3 Max +1.2
稳定性: 22.6 → 23.8
GPT-o3 +1.0
可用性: 98.0 → 99.0
Qwen3 Max +0.9
性价比: 45.5 → 46.4
豆包 Pro +0.4
性价比: 93.2 → 93.6
Gemini 3.1 Pro +0.4
性价比: 24.5 → 24.9
GPT-o3 +0.4
性价比: 9.2 → 9.6
Grok 4 -3.8
稳定性: 29.7 → 25.9
GPT-5.5 -2.7
稳定性: 35.9 → 33.2
Gemini 2.5 Pro -2.0
可用性: 92.0 → 90.0
DeepSeek V4 Pro -1.1
可用性: 90.6 → 89.5
DeepSeek V4 Pro -1.0
稳定性: 41.4 → 40.4
Grok 4 -0.8
性价比: 24.9 → 24.1

显示旧版本维度变动(v5 向后兼容数据)
8 上升
3 下降
0 稳定

本周上升

本周下降