WDCD Run #263: Grok 4 Leads With 97.5 Points as Average Instruction Decay Hits -18.2%
WDCD Run #263 (2026-08-05) evaluated 11 models across three dialogue rounds, recording an average commitment decay of -1
WDCD Run #263 (2026-08-05) evaluated 11 models across three dialogue rounds, recording an average commitment decay of -1
本期WDCD v3.1测试中,GPT-o3上升9.5分、Gemini 2.5 Pro上升7.6分,GLM-4.6下降14.9分、Claude Sonnet 4.6下降10.8分。Grok 4以97.50分保持首位,11模型中3降2升,守约能
WDCD v3.1五大场景横评显示,安全合规全体得分最低,gpt-5.5仅1.8/4;工程规范区分度最小,11模型最低3.2/4。claude-opus-4.7与gpt-5.5偏科差距达2.2分,企业接入生产流程需按场景加护栏。
v2锚点题数据显示,11模型R1确认率91%、R2抵抗率68%、R3诚信率54.5%,豆包Pro R1=0全轮0分,Grok 4、GPT-o3、DeepSeek V4 Pro等6模型R3零崩溃。分析聚焦多约束场景下先确认后崩盘模式,为生产接
WDCD v3.1守约测试显示,Grok 4以97.50分位列第一,豆包Pro以68.00分垫底。R3崩溃率仅5.5%,满分率51.8%。Claude Opus 4.7下滑5.9分,GLM-4.6下滑14.9分,GPT-o3上升9.5分。头
WDCD Run #253 (2026-07-29) tested 11 models across three dialogue rounds, recording an average commitment decay of 4.5%.
本期WDCD v3.1试点数据显示,Claude Opus 4.7与Sonnet 4.6分别上涨6.8分和6.7分,Gemini 3.1 Pro下跌5.6分,GPT-5.5上涨5.3分。Grok 4以94.80分保持首位,3升1降格局下,守
WDCD v3.1试点数据显示,业务规则场景全体得分最低,冠军仅3.5/4,doubao-pro低至1.5/4;工程规范场景区分度最大,最高4/4与最低1/4相差3分。Claude-opus-4.7在四场景拿4/4,唯工程规范跌至3/4,暴
v2锚点题显示,11模型R1确认率95%、R2抵抗率86%,但R3诚信率仅45.5%,9次完全崩盘。GPT-5.5与Qwen3 Max崩盘率达20%,Grok 4等四模型零崩盘,暴露多约束场景下的守约断层。
Grok 4以94.80分位居WDCD v3.1守约榜首,豆包Pro以64.20分垫底,头部与尾部相差30.6分。11个模型中满分率54.5%,R3崩溃率8.2%。Claude Opus 4.7单期提升6.8分,Gemini 3.1 Pro
WDCD Run #247 (2026-07-26) evaluated 11 models across three dialogue rounds, recording an average commitment decay of -1
本期WDCD v3.1试点数据显示,Grok 4以94.20分保持首位,Claude Opus 4.7与Gemini 3.1 Pro分别下降5.9分和5.6分,其余9个模型无上升,Top5中后三名分数集中在83分区间。两模型下滑直接拉开与G
WDCD v3.1测试显示,业务规则场景全体得分最低,Grok-4拿下4/4而Claude-sonnet-4.6仅1.8/4,差距达2.2分。工程规范场景得分最高且最均衡,资源限制与安全合规则暴露明显模型偏科,企业选型需按场景加护栏。
v2锚点题显示11模型R3平均诚信率50.6%,Grok 4零崩溃,GPT-o3与Qwen3 Max崩溃率20%。R1确认率99%到R2抵抗率67%再到R3的断崖,揭示多约束场景下的真实守约表现。
WDCD Run #242 (2026-07-22) evaluated 11 models across three-round multi-turn dialogues, recording an average commitment
本期WDCD v3.1数据显示,GLM-4.6较Run #233上涨13.7分升至92.00分,GPT-o3下滑6.9分降至87.10分,Grok 4以93.80分保持首位。4升2降格局下,约束记忆与破防恢复成为关键分差来源。
WDCD v3.1五大场景横评显示,资源限制与安全合规得分最低,doubao-pro和gpt-5.5多次垫底,claude-opus-4.7在资源限制拿4分却在业务规则仅2.7分,偏科差距最大达2.45分。企业生产接入需针对性加护栏。
v2锚点题显示R1确认率100%、R2抵抗率91%、R3诚信率40.9%,4/11模型R3得0分。所有崩溃案例均发生在业务规则场景的订单流程约束上,揭示模型在连续施压下的守约断裂规律。
Grok 4 以 WDCD 93.80 分位居守约排行榜首位,豆包 Pro 以 67.30 分垫底。11 个模型中头部与尾部差距达 26.5 分,R3 崩溃率仅 3.6%。v3 多轮施压下,S_hold 守约生存分差异成为拉开排名的核心因素
WDCD Run #233 (2026-07-15) evaluated 11 frontier models on multi-turn commitment integrity, recording an average instruc