YZ Index
AI模型每周变动排行榜
自动评分 · 自动变动计算 · 每周自动更新
基準: Run #323 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-09-14 05:06 SGT
最新: Run #333 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-09-21 05:05 SGT
主变动 综合力 core_overall
Gemini 2.5 Pro
+6.6
65.3 → 71.9
GPT-o3
+4.7
76.6 → 81.3
Qwen3 Max
+3.3
70.0 → 73.3
Claude Opus 4.7
+2.8
80.1 → 82.8
Gemini 3.1 Pro
+1.8
70.7 → 72.5
Claude Sonnet 4.6
+0.5
76.8 → 77.3
Grok 4
-1.4
79.6 → 78.2
GPT-5.5
-1.4
77.8 → 76.4
豆包 Pro
-1.0
72.0 → 71.0
1 个模型保持稳定
DeepSeek V4 Pro (69.4)
侧面排行榜变动 工程判断 / 任务表达
豆包 Pro
+7.5
任务表达: 85.8 → 93.3
Claude Sonnet 4.6
+7.0
任务表达: 80.4 → 87.4
Claude Opus 4.7
+4.4
工程判断: 82.8 → 87.2
Claude Sonnet 4.6
+3.8
工程判断: 79.8 → 83.6
Qwen3 Max
+2.5
任务表达: 47.8 → 50.3
GPT-5.5
+2.2
工程判断: 87.8 → 90.0
Grok 4
+2.1
任务表达: 85.8 → 87.9
Gemini 2.5 Pro
-15.0
任务表达: 80.8 → 65.8
Gemini 2.5 Pro
-13.2
工程判断: 76.5 → 63.3
Gemini 3.1 Pro
-10.0
工程判断: 87.8 → 77.8
DeepSeek V4 Pro
-5.0
工程判断: 82.8 → 77.8
Grok 4
-4.7
工程判断: 60.3 → 55.6
DeepSeek V4 Pro
-2.7
任务表达: 76.3 → 73.6
Claude Opus 4.7
-2.5
任务表达: 72.8 → 70.3
GPT-o3
-2.5
任务表达: 80.8 → 78.3
GPT-o3
-0.6
工程判断: 83.0 → 82.4
Qwen3 Max
-0.6
工程判断: 40.6 → 40.0
运营信号变动 稳定性 / 可用性 / 性价比
Gemini 2.5 Pro
+6.3
稳定性: 28.9 → 35.2
GPT-o3
+5.2
稳定性: 32.1 → 37.3
Claude Opus 4.7
+4.6
稳定性: 34.9 → 39.5
Claude Sonnet 4.6
+3.7
稳定性: 33.0 → 36.7
Gemini 3.1 Pro
+2.2
稳定性: 26.1 → 28.3
Gemini 2.5 Pro
+1.7
性价比: 34.6 → 36.3
Qwen3 Max
+1.2
稳定性: 22.6 → 23.8
GPT-o3
+1.0
可用性: 98.0 → 99.0
Qwen3 Max
+0.9
性价比: 45.5 → 46.4
豆包 Pro
+0.4
性价比: 93.2 → 93.6
Gemini 3.1 Pro
+0.4
性价比: 24.5 → 24.9
GPT-o3
+0.4
性价比: 9.2 → 9.6
Grok 4
-3.8
稳定性: 29.7 → 25.9
GPT-5.5
-2.7
稳定性: 35.9 → 33.2
Gemini 2.5 Pro
-2.0
可用性: 92.0 → 90.0
DeepSeek V4 Pro
-1.1
可用性: 90.6 → 89.5
DeepSeek V4 Pro
-1.0
稳定性: 41.4 → 40.4
Grok 4
-0.8
性价比: 24.9 → 24.1