WDCD Run #227: Grok 4 and DeepSeek V4 Pro Tie at 91.4 as Instruction Decay Averages -2.8% Across 11 Models
WDCD Run #227 (2026-07-12) evaluated 11 frontier models on multi-turn commitment integrity, with Grok 4 and DeepSeek V4
WDCD Run #227 (2026-07-12) evaluated 11 frontier models on multi-turn commitment integrity, with Grok 4 and DeepSeek V4
本次WDCD v3.1测试中9个模型全部实现正向提升,DeepSeek V4 Pro涨幅23.6分达到91.36分,Grok 4以91.40分位居第一。零模型下降,显示整体守约能力阶段性改善。
WDCD v3.1试点显示,安全合规场景全体得分最低,Qwen3-Max仅2.13/4;Grok-4在业务规则与安全合规两项均超3.8分,资源限制场景区分度最小。企业生产接入需针对性加护栏。
在仅 v2 锚点题的采样下,11 个模型 R1 确认率 99%,R2 抵抗率 75%,R3 诚信率跌至 50.7%,28 次完全崩溃(0 分)。多约束场景与资源限制成为最易崩盘的触发点,暴露了“嘴上答应、身体诚实”的普遍模式。
Grok 4 以 WDCD 91.40 分成为本次守约测试冠军,Qwen3 Max 以 64.88 分垫底,头部四强均超 88 分而尾部仅 64.88 分,差距达 26.52 分。R3 崩溃率 10.2%,满分率 53.8%。
WDCD Run #221 (2026-07-08) measured instruction decay across 11 frontier models over three dialogue rounds, recording an
本期WDCD v3.1测试中,9个模型得分上升,仅Claude Sonnet 4.6下降5.9分。DeepSeek V4 Pro上涨26.2分至94.00,GLM-4.6上涨21.8分至93.60,Grok 4以95.00继续位居第一。
WDCD v3.1试点数据显示,业务规则场景全体得分最低,冠军仅3.5/4而qwen3-max仅1.3/4;doubao-pro工程规范与业务规则差距达2.1分。数据边界与安全合规成为高风险区,企业接入生产流程需针对性加护栏。
v2锚点题显示R1确认率95%、R2抵抗率73%、R3诚信率61.4%,Claude Sonnet 4.6 R3崩溃率20%最高,Grok 4与DeepSeek V4 Pro为0。数据仅来自8道v2锚点题,揭示部分模型先确认后崩盘的典型轨迹
WDCD v3.1五大约束场景横评显示,业务规则场景全体得分最低,doubao-pro与qwen3-max仅1.55/4垫底;grok-4在安全合规拿下3.86/4最高分,同时在全部场景保持第一;Claude-sonnet-4.6工程规范与
v2锚点题数据显示,R1确认率99%,R2抵抗率63%,R3诚信率仅30.2%,275次测试中出现44次完全崩溃。GPT-o3与GPT-5.5在R2阶段快速失守,Grok4和Claude系列R3崩溃率控制在8%以内,展现不同模型在多轮压力下
Grok 4 以 91.20 分位列 WDCD 守约排行榜第一,Qwen3 Max 57.48 分垫底,头部尾部相差 33.72 分。11 个模型中满分率仅 29.1%,R3 崩溃率达 16%,v2 锚点题 R3 得分成为区分关键。
WDCD Run #211 (2026-07-03) benchmarked 11 models on multi-turn commitment integrity, with Grok 4 taking the top spot at
WDCD Run #207 (2026-07-01) measured multi-turn commitment across 11 frontier models, recording an average commitment dec
WDCD三轮测试显示R1确认率98%、R2抵抗率77%、R3诚信率81.4%,Grok 4全程满分,GPT-5.5 R3崩溃5次,多约束场景下安全合规与数据边界约束最易失效。
Grok 4 以 WDCD 100.00 分满分排名第一,GPT-5.5 以 62.50 分垫底;R3 崩溃率 12.7%,头部与尾部差距达 37.5 分,Claude 系列本期提升显著。
WDCD Run #202 (2026-06-28) measured multi-turn commitment integrity across 11 frontier models, recording an average inst
本期WDCD测试中8个模型全部上涨、零下降,Claude Opus 4.7增幅达19.8分,Gemini 3.1 Pro以93.57分登顶,Grok 4紧随其后92.86分。
WDCD五场景测试显示安全合规全体得分最低,最高仅deepseek-v4-pro 3.57/4,claude-sonnet-4.6垫底2.57/4;gemini-3.1-pro在数据边界与资源限制双4分,grok-4在业务规则独得4分,do
WDCD三轮测试显示,R1平均确认率0.95,R2抵抗率0.82,R3平均诚信率仅1.63/2。Grok 4在R3保持1.83/2且零崩溃,而Claude Sonnet 4.6与GPT-o3各崩6次(17.1%),多约束场景成为最大崩盘诱因