YZ Index
AI模型每周变动排行榜
自动评分 · 自动变动计算 · 每周自动更新
基準: Run #259 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-08-03 05:03 SGT
最新: Run #273 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-08-10 05:05 SGT
主变动 综合力 core_overall
Claude Opus 4.7
+4.9
82.6 → 87.5
GLM-4.6
+2.9
53.1 → 56.1
Grok 4
+2.8
76.4 → 79.2
GPT-o3
+2.2
76.7 → 78.9
Gemini 2.5 Pro
-6.8
70.0 → 63.2
Qwen3 Max
-3.9
71.5 → 67.6
Gemini 3.1 Pro
-3.8
70.8 → 66.9
Claude Sonnet 4.6
-2.1
72.9 → 70.8
2 个模型保持稳定
DeepSeek V4 Pro (78.8)
GPT-5.5 (75.9)
侧面排行榜变动 工程判断 / 任务表达
Claude Opus 4.7
+15.0
任务表达: 70.3 → 85.3
Gemini 2.5 Pro
+10.0
任务表达: 65.8 → 75.8
Gemini 2.5 Pro
+4.9
工程判断: 67.9 → 72.8
Qwen3 Max
+2.5
任务表达: 47.8 → 50.3
Claude Sonnet 4.6
+1.2
工程判断: 82.5 → 83.7
Claude Opus 4.7
+1.1
工程判断: 85.0 → 86.1
DeepSeek V4 Pro
+0.8
工程判断: 84.9 → 85.7
GLM-4.6
-33.6
工程判断: 55.0 → 21.4
GLM-4.6
-12.5
任务表达: 50.0 → 37.5
Grok 4
-12.2
工程判断: 71.4 → 59.2
Gemini 3.1 Pro
-7.2
工程判断: 80.0 → 72.8
GPT-o3
-4.4
工程判断: 85.7 → 81.3
Grok 4
-2.3
任务表达: 80.8 → 78.5
GPT-5.5
-2.2
工程判断: 90.0 → 87.8
诚实性评估变动 integrity_label 变迁
GLM-4.6
诚实性警告
✔ pass →
⚠ warn
运营信号变动 稳定性 / 可用性 / 性价比
豆包 Pro
+36.1
稳定性: 38.9 → 75.0
Claude Opus 4.7
+9.0
稳定性: 36.4 → 45.4
GPT-o3
+2.1
稳定性: 34.0 → 36.1
DeepSeek V4 Pro
+2.0
可用性: 97.0 → 99.0
GLM-4.6
+1.1
性价比: 31.6 → 32.7
Claude Opus 4.7
+0.4
性价比: 5.5 → 5.9
豆包 Pro
-81.5
性价比: 81.5 → 0.0
豆包 Pro
-69.0
可用性: 69.0 → 0.0
GLM-4.6
-7.5
稳定性: 31.7 → 24.2
Gemini 2.5 Pro
-3.6
稳定性: 34.8 → 31.2
Gemini 3.1 Pro
-3.2
稳定性: 23.4 → 20.2
DeepSeek V4 Pro
-2.8
稳定性: 40.2 → 37.4
Claude Sonnet 4.6
-2.6
稳定性: 32.2 → 29.6
GLM-4.6
-2.4
可用性: 69.5 → 67.1
Gemini 2.5 Pro
-1.7
性价比: 35.6 → 33.9
Qwen3 Max
-1.7
性价比: 46.0 → 44.3
Gemini 3.1 Pro
-1.5
性价比: 24.3 → 22.8
Grok 4
-0.6
稳定性: 29.4 → 28.8
显示旧版本维度变动(v5 向后兼容数据)
3
上升
8
下降
0
稳定