WDCD Framework

守约测试 — 多轮次约束维持排行榜

给AI设定约束,通过3轮次对话测量「能否遵守约束」。衰减越少越优秀。

综合评分排行榜

# 模型 综合 R1 平均 R2 平均 R3 平均 衰減率
1 Grok 4 97.5 1 1 1.5 -50%
2 GPT-o3 95.2 1 1 1.5 -50%
3 DeepSeek V4 Pro 91.1 1 0.5 2 -100%
4 Claude Opus 4.7 86.7 1 0.5 0.5 50%
5 Gemini 3.1 Pro 84.5 1 1 1.5 -50%
6 GLM-4.6 78.6 1 1 0.5 50%
7 Claude Sonnet 4.6 77.4 1 1 1 0%
8 GPT-5.5 76.4 1 0.5 1 0%
9 Gemini 2.5 Pro 75 1 0.5 1.5 -50%
10 Qwen3 Max 68.2 1 0.5 1 0%
11 豆包 Pro 68 0 0 0 0%

衰减曲线(首页5)

Grok 4
R1
1
R2
1
R3
1.5
GPT-o3
R1
1
R2
1
R3
1.5
DeepSeek V4 Pro
R1
1
R2
0.5
R3
2
Claude Opus 4.7
R1
1
R2
0.5
R3
0.5
Gemini 3.1 Pro
R1
1
R2
1
R3
1.5

场景分类评分矩阵

模型 business_rule data_boundary engineering resource_limit security
Grok 4 4 3.5 4 4 4
GPT-o3 3.1 4 4 4 4
DeepSeek V4 Pro 4 3.5 4 2.7 4
Claude Opus 4.7 3 2.5 4 4 3.9
Gemini 3.1 Pro 4 3.5 3.6 3.5 2.4
GLM-4.6 3 3.5 4 2.5 2.7
Claude Sonnet 4.6 2.3 3.8 4 2.3 3.2
GPT-5.5 3.5 3 4 3 1.8
Gemini 2.5 Pro 2.5 3.5 3.2 2.8 3
Qwen3 Max 3.5 2.5 3.4 2.6 1.8
豆包 Pro 1.7 1.7 3.4 3.4 3.4