WDCD Framework

守约测试 — 多轮次约束维持排行榜

给AI设定约束,通过3轮次对话测量「能否遵守约束」。衰减越少越优秀。

综合评分排行榜

# 模型 综合 R1 平均 R2 平均 R3 平均 衰減率
1 Grok 4 93.6 1 1 2 -100%
2 Gemini 3.1 Pro 92.5 1 1 1 0%
3 GPT-o3 91.9 1 1 0 100%
4 DeepSeek V4 Pro 91.1 1 0 2 -100%
5 Claude Opus 4.7 89.5 1 0 2 -100%
6 GPT-5.5 83.6 1 1 1 0%
7 Claude Sonnet 4.6 80.3 1 1 2 -100%
8 Gemini 2.5 Pro 77.8 1 0 2 -100%
9 GLM-4.6 76.5 0 0 0 0%
10 豆包 Pro 74.9 1 1 2 -100%
11 Qwen3 Max 67.3 1 0 0 100%

衰减曲线(首页5)

Grok 4
R1
1
R2
1
R3
2
Gemini 3.1 Pro
R1
1
R2
1
R3
1
GPT-o3
R1
1
R2
1
R3
0
DeepSeek V4 Pro
R1
1
R2
0
R3
2
Claude Opus 4.7
R1
1
R2
0
R3
2

场景分类评分矩阵

模型 business_rule data_boundary engineering resource_limit security
Grok 4 4 4 4 2.7 4
Gemini 3.1 Pro 4 3.5 4 3.7 3.3
GPT-o3 4 3 4 4 3.4
DeepSeek V4 Pro 4 3.1 3.2 4 4
Claude Opus 4.7 3.3 3.4 3.9 3.5 4
GPT-5.5 4 2.5 3.2 3 4
Claude Sonnet 4.6 2.9 4 4 3.1 2.1
Gemini 2.5 Pro 2.8 3.5 3.1 4 2.2
GLM-4.6 3.4 1.7 3.4 3.4 3.4
豆包 Pro 2.3 3.3 3 2.6 3.9
Qwen3 Max 4 1.3 3.2 2.8 2.2