97.7 vs 75.2:DeepSeek V4 Pro 守约碾压 Qwen3 Max 22分差距
DeepSeek V4 Pro 以 97.70 分登顶 WDCD v3.1 守约榜,Qwen3 Max 75.20 分垫底,头部与尾部差距 22.5 分。R3 崩溃率仅 0.9%,满分率 60%,显示当前模型在多轮施压下的守约稳定性已进入新
DeepSeek V4 Pro 以 97.70 分登顶 WDCD v3.1 守约榜,Qwen3 Max 75.20 分垫底,头部与尾部差距 22.5 分。R3 崩溃率仅 0.9%,满分率 60%,显示当前模型在多轮施压下的守约稳定性已进入新
Grok 4以96.30分位居WDCD v3.1守约榜首,豆包Pro 67.90分垫底,11模型中满分率58.2%、R3崩溃率0%。头部三强与尾部三强平均分差超24分,Claude Sonnet 4.6单期上涨13.5分,GPT-5.5下滑
Grok 4 以 WDCD 94.00 分位列第一,豆包 Pro 68.17 分垫底,头部与尾部相差 25.83 分。R3 施压轮次崩溃率仅 8.2%,满分率 56.7%。数据揭示不同模型在多轮渐进施压下的真实守约差异,为企业接入生产流程提
Grok 4 以 94.80 分位列 WDCD v3.1 守约榜第一,Qwen3 Max 69.20 分垫底,11 个模型中 R3 崩溃率仅 4.5%。头部与尾部相差 25.6 分,GPT-o3 R3 直接 0 分暴露高压场景脆弱性。数据揭
Grok 4以91.04分位居WDCD守约榜首,豆包Pro仅58分垫底,R3施压轮崩溃率达12.4%。11个模型中头部与尾部差距超过33分,Claude Sonnet 4.6单期提升8.8分,GPT-5.5提升5分。数据揭示多轮渐进施压下模
Grok 4 以 WDCD 93.80 分位居守约排行榜首位,豆包 Pro 以 67.30 分垫底。11 个模型中头部与尾部差距达 26.5 分,R3 崩溃率仅 3.6%。v3 多轮施压下,S_hold 守约生存分差异成为拉开排名的核心因素
Grok 4 以 WDCD 91.40 分成为本次守约测试冠军,Qwen3 Max 以 64.88 分垫底,头部四强均超 88 分而尾部仅 64.88 分,差距达 26.52 分。R3 崩溃率 10.2%,满分率 53.8%。