基準: Run #259 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-08-03 05:03 SGT 最新: Run #273 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-08-10 05:05 SGT

主变动 综合力 core_overall

Claude Opus 4.7 +4.9
82.6 → 87.5
GLM-4.6 +2.9
53.1 → 56.1
Grok 4 +2.8
76.4 → 79.2
GPT-o3 +2.2
76.7 → 78.9
Gemini 2.5 Pro -6.8
70.0 → 63.2
Qwen3 Max -3.9
71.5 → 67.6
Gemini 3.1 Pro -3.8
70.8 → 66.9
Claude Sonnet 4.6 -2.1
72.9 → 70.8
2 个模型保持稳定
DeepSeek V4 Pro (78.8) GPT-5.5 (75.9)

侧面排行榜变动 工程判断 / 任务表达

Claude Opus 4.7 +15.0
任务表达: 70.3 → 85.3
Gemini 2.5 Pro +10.0
任务表达: 65.8 → 75.8
Gemini 2.5 Pro +4.9
工程判断: 67.9 → 72.8
Qwen3 Max +2.5
任务表达: 47.8 → 50.3
Claude Sonnet 4.6 +1.2
工程判断: 82.5 → 83.7
Claude Opus 4.7 +1.1
工程判断: 85.0 → 86.1
DeepSeek V4 Pro +0.8
工程判断: 84.9 → 85.7
GLM-4.6 -33.6
工程判断: 55.0 → 21.4
GLM-4.6 -12.5
任务表达: 50.0 → 37.5
Grok 4 -12.2
工程判断: 71.4 → 59.2
Gemini 3.1 Pro -7.2
工程判断: 80.0 → 72.8
GPT-o3 -4.4
工程判断: 85.7 → 81.3
Grok 4 -2.3
任务表达: 80.8 → 78.5
GPT-5.5 -2.2
工程判断: 90.0 → 87.8

诚实性评估变动 integrity_label 变迁

GLM-4.6 诚实性警告
✔ pass⚠ warn

运营信号变动 稳定性 / 可用性 / 性价比

豆包 Pro +36.1
稳定性: 38.9 → 75.0
Claude Opus 4.7 +9.0
稳定性: 36.4 → 45.4
GPT-o3 +2.1
稳定性: 34.0 → 36.1
DeepSeek V4 Pro +2.0
可用性: 97.0 → 99.0
GLM-4.6 +1.1
性价比: 31.6 → 32.7
Claude Opus 4.7 +0.4
性价比: 5.5 → 5.9
豆包 Pro -81.5
性价比: 81.5 → 0.0
豆包 Pro -69.0
可用性: 69.0 → 0.0
GLM-4.6 -7.5
稳定性: 31.7 → 24.2
Gemini 2.5 Pro -3.6
稳定性: 34.8 → 31.2
Gemini 3.1 Pro -3.2
稳定性: 23.4 → 20.2
DeepSeek V4 Pro -2.8
稳定性: 40.2 → 37.4
Claude Sonnet 4.6 -2.6
稳定性: 32.2 → 29.6
GLM-4.6 -2.4
可用性: 69.5 → 67.1
Gemini 2.5 Pro -1.7
性价比: 35.6 → 33.9
Qwen3 Max -1.7
性价比: 46.0 → 44.3
Gemini 3.1 Pro -1.5
性价比: 24.3 → 22.8
Grok 4 -0.6
稳定性: 29.4 → 28.8

显示旧版本维度变动(v5 向后兼容数据)
3 上升
8 下降
0 稳定

本周上升

本周下降