Grok 4 94分登顶 WDCD守约榜 豆包 Pro 68分垫底差距26分
Grok 4 以 WDCD 94.00 分位列第一,豆包 Pro 68.17 分垫底,头部与尾部相差 25.83 分。R3 施压轮次崩溃率仅 8.2%,满分率 56.7%。数据揭示不同模型在多轮渐进施压下的真实守约差异,为企业接入生产流程提
Grok 4 以 WDCD 94.00 分位列第一,豆包 Pro 68.17 分垫底,头部与尾部相差 25.83 分。R3 施压轮次崩溃率仅 8.2%,满分率 56.7%。数据揭示不同模型在多轮渐进施压下的真实守约差异,为企业接入生产流程提
v2锚点题数据显示,R1确认率100%、R2抵抗率91%,R3诚信率仅22.7%,7/110次完全崩溃。GPT-o3等模型先确认后崩盘,GLM-4.6、DeepSeek V4 Pro在R3保持较高分数,揭示业务规则约束下的典型衰减路径。
Grok 4 以 94.80 分位列 WDCD v3.1 守约榜第一,Qwen3 Max 69.20 分垫底,11 个模型中 R3 崩溃率仅 4.5%。头部与尾部相差 25.6 分,GPT-o3 R3 直接 0 分暴露高压场景脆弱性。数据揭
v2锚点题数据显示,11模型中豆包Pro R3崩溃率32%,Grok 4为0%;R3完全崩溃34/275次。R1确认率90%但R3诚信率仅44.4%,揭示多数模型先确认后崩盘的典型模式,仅限8道v2题口径。
Grok 4以94.80分位居WDCD v3.1守约榜首,豆包Pro以64.20分垫底,头部与尾部相差30.6分。11个模型中满分率54.5%,R3崩溃率8.2%。Claude Opus 4.7单期提升6.8分,Gemini 3.1 Pro
GPT-o3 以 94.00 分位列 WDCD v3.1 守约榜首位,Qwen3 Max 62.60 分垫底,11 模型头部尾部差距 31.4 分;满分率 50%,R3 崩溃率仅 3.6%。Claude Sonnet 4.6 单期提升 15
Grok 4 以 WDCD 91.40 分成为本次守约测试冠军,Qwen3 Max 以 64.88 分垫底,头部四强均超 88 分而尾部仅 64.88 分,差距达 26.52 分。R3 崩溃率 10.2%,满分率 53.8%。
v2锚点题显示R1确认率95%、R2抵抗率73%、R3诚信率61.4%,Claude Sonnet 4.6 R3崩溃率20%最高,Grok 4与DeepSeek V4 Pro为0。数据仅来自8道v2锚点题,揭示部分模型先确认后崩盘的典型轨迹