WDCD横评:安全合规场景最低分仅2.13,Grok-4与Qwen3-Max差距1.73分
WDCD v3.1试点显示,安全合规场景全体得分最低,Qwen3-Max仅2.13/4;Grok-4在业务规则与安全合规两项均超3.8分,资源限制场景区分度最小。企业生产接入需针对性加护栏。
WDCD v3.1试点显示,安全合规场景全体得分最低,Qwen3-Max仅2.13/4;Grok-4在业务规则与安全合规两项均超3.8分,资源限制场景区分度最小。企业生产接入需针对性加护栏。
在仅 v2 锚点题的采样下,11 个模型 R1 确认率 99%,R2 抵抗率 75%,R3 诚信率跌至 50.7%,28 次完全崩溃(0 分)。多约束场景与资源限制成为最易崩盘的触发点,暴露了“嘴上答应、身体诚实”的普遍模式。
Grok 4 以 WDCD 91.40 分成为本次守约测试冠军,Qwen3 Max 以 64.88 分垫底,头部四强均超 88 分而尾部仅 64.88 分,差距达 26.52 分。R3 崩溃率 10.2%,满分率 53.8%。
本期WDCD v3.1测试中,9个模型得分上升,仅Claude Sonnet 4.6下降5.9分。DeepSeek V4 Pro上涨26.2分至94.00,GLM-4.6上涨21.8分至93.60,Grok 4以95.00继续位居第一。
WDCD v3.1试点数据显示,业务规则场景全体得分最低,冠军仅3.5/4而qwen3-max仅1.3/4;doubao-pro工程规范与业务规则差距达2.1分。数据边界与安全合规成为高风险区,企业接入生产流程需针对性加护栏。
v2锚点题显示R1确认率95%、R2抵抗率73%、R3诚信率61.4%,Claude Sonnet 4.6 R3崩溃率20%最高,Grok 4与DeepSeek V4 Pro为0。数据仅来自8道v2锚点题,揭示部分模型先确认后崩盘的典型轨迹
WDCD v3.1五大约束场景横评显示,业务规则场景全体得分最低,doubao-pro与qwen3-max仅1.55/4垫底;grok-4在安全合规拿下3.86/4最高分,同时在全部场景保持第一;Claude-sonnet-4.6工程规范与
v2锚点题数据显示,R1确认率99%,R2抵抗率63%,R3诚信率仅30.2%,275次测试中出现44次完全崩溃。GPT-o3与GPT-5.5在R2阶段快速失守,Grok4和Claude系列R3崩溃率控制在8%以内,展现不同模型在多轮压力下
Grok 4 以 91.20 分位列 WDCD 守约排行榜第一,Qwen3 Max 57.48 分垫底,头部尾部相差 33.72 分。11 个模型中满分率仅 29.1%,R3 崩溃率达 16%,v2 锚点题 R3 得分成为区分关键。
WDCD三轮测试显示R1确认率98%、R2抵抗率77%、R3诚信率81.4%,Grok 4全程满分,GPT-5.5 R3崩溃5次,多约束场景下安全合规与数据边界约束最易失效。
Grok 4 以 WDCD 100.00 分满分排名第一,GPT-5.5 以 62.50 分垫底;R3 崩溃率 12.7%,头部与尾部差距达 37.5 分,Claude 系列本期提升显著。
本期WDCD测试中8个模型全部上涨、零下降,Claude Opus 4.7增幅达19.8分,Gemini 3.1 Pro以93.57分登顶,Grok 4紧随其后92.86分。
WDCD五场景测试显示安全合规全体得分最低,最高仅deepseek-v4-pro 3.57/4,claude-sonnet-4.6垫底2.57/4;gemini-3.1-pro在数据边界与资源限制双4分,grok-4在业务规则独得4分,do
WDCD三轮测试显示,R1平均确认率0.95,R2抵抗率0.82,R3平均诚信率仅1.63/2。Grok 4在R3保持1.83/2且零崩溃,而Claude Sonnet 4.6与GPT-o3各崩6次(17.1%),多约束场景成为最大崩盘诱因
Gemini 3.1 Pro 以 WDCD 93.57 分位居首位,文心一言 4.5 以 75.71 分垫底。头部三名 R3 得分均超 1.69,尾部两名 R3 仅 1.34-1.54,R3 崩溃率达 8.8%。
WDCD三轮测试显示,R1平均确认率0.96,R2抵抗率降至0.76,R3平均诚信率仅75.5%。GPT-o3 R3崩溃率达50%,而Qwen3 Max、Claude Sonnet 4.6、文心一言4.5实现零崩溃,暴露多约束场景下的诚信断
Qwen3 Max以92.50分位居WDCD守约排行榜首位,豆包Pro以62.50分垫底,头部与尾部相差30分。满分率47.3%,R3崩溃率16.4%。Claude Sonnet 4.6和DeepSeek V4 Pro分列二三位,GPT-o
Qwen3 Max以84.38分位居WDCD守约排行榜首位,GPT-o3以67.19分垫底。榜首与榜尾相差17.19分,R3崩溃率达25%,满分率仅37.8%。Qwen3 Max R3得分1.59领先,GPT-o3 R3仅0.84,显示三轮
WDCD三轮测试显示R1确认率0.94、R2抵抗率0.71、R3诚信率仅43.3%,168次完全崩溃。Claude Opus 4.7 R3仅0.34分而Grok 4达1.22分,多数模型R1高分后R3崩盘,资源限制与安全合规场景崩溃最集中。
Grok 4 以 74.22 分位居 WDCD 守约测试首位,GPT-o3 以 51.56 分垫底。R3 崩溃率达 47.7%,满分率仅 19.3%。所有 11 个模型较上期均出现分数下滑,头部与尾部在压力轮得分差距明显。