WDCD Run #311: Grok 4 Leads with 93.2 Points as GLM-4.6 Sets New Decay Resistance Record
WDCD Run #311 (2026-09-06) evaluated 11 models across three-round multi-turn dialogues, with Grok 4 taking the top score
WDCD Run #311 (2026-09-06) evaluated 11 models across three-round multi-turn dialogues, with Grok 4 taking the top score
Claude Sonnet 4.6 WDCD分数下降5分,豆包Pro上升7.5分。Grok 4以93.21分保持首位,GLM-4.6 91.38分紧随。仅两模型出现显著变化,v3多轮施压下守约生存与约束记忆差异成为关键观察点。
WDCD v3.1测试显示安全合规场景得分最低,qwen3-max仅2.19/4;glm-4.6在资源限制、业务规则、工程规范三场景均列前二,最大场景差距达1.67分。
v2锚点题数据显示,R1确认率100%,R2抵抗率79%,R3诚信率49.5%,29/319次完全崩溃。Grok 4与GLM-4.6 R3崩溃率最低(3.4%),Claude Opus 4.7与Qwen3 Max最高(17.2%)。分析聚焦
Grok 4以93.21分位列WDCD守约榜第一,Qwen3 Max以74.31分垫底,头部与尾部相差18.9分。满分率58%,R3崩溃率9.1%。Claude Sonnet 4.6较上期下降5.0分,豆包 Pro上升7.5分。
WDCD Run #306 (2026-09-02) evaluated 11 models across three dialogue rounds, recording an average commitment decay of -4
Gemini 3.1 Pro以97.70分登顶WDCD,Gemini 2.5 Pro单期上升22.2分,Claude Sonnet 4.6成为唯一下降模型(-13分)。5升1降格局下,守约生存与约束记忆分化明显,企业生产接入需优先高分模型。
安全合规场景全体得分最低,qwen3-max仅2/4,deepseek-v4-pro仅2.5/4;数据边界多模型4/4;deepseek-v4-pro业务规则4/4却安全合规2.5/4,差距1.5分。企业接入生产流程时需按场景加护栏。
WDCD v3.1试点中,8道v2锚点题显示R1确认率100%、R2抵抗率73%、R3诚信率72.7%,110次采样中3次R3完全崩溃。GLM-4.6、DeepSeek V4 Pro、Qwen3 Max在安全合规多约束场景下先确认后崩盘,G
Gemini 3.1 Pro以97.70分位居WDCD v3.1守约榜首位,Qwen3 Max 70.30分垫底,11模型中满分率68.2%,R3崩溃率仅2.7%。头部与尾部在R3施压阶段差距达2.00分,生产接入需重点关注安全合规场景。
WDCD Run #296 (2026-08-26) recorded 0% average commitment decay across 11 tested models, with Grok 4 topping the ranking
本期WDCD v3.1测试中,Claude Sonnet 4.6较Run #291上涨13.5分升至91.60分,Gemini 2.5 Pro下跌12.5分,Grok 4以96.30分继续领跑。3升4降格局下,守约能力分化加剧,对生产流程接
WDCD v3.1五大场景测试显示,安全合规场景全体得分最低,qwen3-max仅1.5/4,claude-sonnet-4.6满分。doubao-pro工程规范3.9/4却业务规则仅2.15/4,差距1.75。企业接入生产流程时,安全合规
v2 锚点题数据显示 11 个模型 R1 确认率、R2 抵抗率、R3 诚信率均为 0%,R3 完全崩溃 0/10。所有模型在三轮施压下均未守约,凸显当前大模型在硬约束下的系统性脆弱。
Grok 4以96.30分位居WDCD v3.1守约榜首,豆包Pro 67.90分垫底,11模型中满分率58.2%、R3崩溃率0%。头部三强与尾部三强平均分差超24分,Claude Sonnet 4.6单期上涨13.5分,GPT-5.5下滑
WDCD Run #291 (2026-08-23) evaluated 11 models across three dialogue rounds, recording an average commitment decay of -7
本期WDCD v3.1试点显示4模型分数上升、0模型下降。豆包Pro上涨10.2分,Gemini 2.5 Pro上涨8.1分,GLM-4.6上涨6.8分,Qwen3 Max上涨7.6分。Grok 4以94.00分保持首位,GLM-4.6升至
WDCD v3.1试点数据显示,业务规则场景平均得分最低,Doubao-Pro仅1.83/4;Grok-4在资源限制、安全合规、业务规则三场景均列前二;工程规范整体最高但区分度最小。企业接入生产流程时需针对性加护栏。
v2锚点题数据显示,R1确认率97%、R2抵抗率77%、R3诚信率仅51.3%,26次完全崩溃。Grok 4 R3零崩溃,GLM-4.6与Claude Opus 4.7各仅1次。分析聚焦多约束场景与渐进施压下的守约差异,为生产接入提供具体护
Grok 4 以 WDCD 94.00 分位列第一,豆包 Pro 68.17 分垫底,头部与尾部相差 25.83 分。R3 施压轮次崩溃率仅 8.2%,满分率 56.7%。数据揭示不同模型在多轮渐进施压下的真实守约差异,为企业接入生产流程提