4模型WDCD集体上涨无人下滑 Grok 4仍以94分领跑

本期WDCD v3.1试点中,豆包Pro、Gemini 2.5 Pro、GLM-4.6、Qwen3 Max四模型得分分别上升10.2分、8.1分、6.8分、7.6分,其余参评模型无下降记录。Grok 4以94.00分位列第一,GLM-4.6以88.93分位列第二。

数据事实:上升集中在特定约束场景

四模型上升幅度均超过6分,集中在v3题的8-12轮对话后段。GLM-4.6从上期水平升至88.93分,进入Top 5第二位,DeepSeek V4 Pro以88.14分紧随其后。Claude Sonnet 4.6与Gemini 3.1 Pro分别以86.69分和86.48分位列第四、第五。所有上升模型在S_hold守约生存项得分提升明显,该项权重60分,破约越晚得分越高。

成因分析:多轮施压下的约束记忆差异

WDCD v3题设计包含立约后连续施压与KBV复述探针。上升模型在资源限制与安全合规两类约束场景表现更稳。豆包Pro上升10.2分,可能源于对“切香肠”式逐级抬压的抵抗力增强,S_kbv约束记忆15分项得分相应提高。Gemini 2.5 Pro上升8.1分,Qwen3 Max上升7.6分,均显示在权威特批施压轮次中更少提前破约。GLM-4.6上升6.8分后进入前二,其S_recover破防恢复10分项可能获得改善。

相比之下,Grok 4保持94.00分高位,说明其在沉没成本抬压与终轮诚实自报环节仍具优势。v2锚点题折算后等权平均结果显示,上升模型在R3施压轮得分贡献更大。

选型含义:生产流程接入的实际边界

对把AI接入生产流程的企业而言,WDCD分数直接对应可信赖的约束执行能力。Grok 4 94.00分表明其适合数据边界与工程规范场景,可在无额外护栏情况下使用。GLM-4.6 88.93分与DeepSeek V4 Pro 88.14分接近,适合资源限制类任务,但安全合规场景仍需设置二次校验。Claude Sonnet 4.6 86.69分与Gemini 3.1 Pro 86.48分可用于业务规则执行,但多轮对话超过8轮时建议加入人工复核节点。

豆包Pro本期大幅上升,提示其在业务规则场景下守约稳定性提升,可在内部工具链中扩大试点范围。

战略判断:守约能力被低估的信号

四模型集体上升、零模型下降的格局,显示当前版本v3.1对prompt敏感度变化的捕捉更敏感。GLM-4.6从此前位置跃升至88.93分,说明其约束记忆能力可能被市场低估,下一期需验证其在工程规范场景的S_integrity诚实自报表现。Grok 4持续高位94.00分,守约能力未被高估。

分析认为,上升模型的共同点在于KBV复述探针通过率提高,这可能是模型更新或训练中强化了多约束并行处理。企业选型时,94分以上模型可直接用于高风险合规流程,85-90分区间模型需在业务规则场景增加护栏。

下一期需重点观察GLM-4.6与Qwen3 Max在v3题终轮诚实复盘环节的S_integrity得分是否继续提升。

总体判断,WDCD v3.1试点揭示守约能力分化正在加剧。Grok 4 94.00分仍为当前最可靠基准,GLM-4.6 88.93分已形成追赶压力。企业应根据具体约束场景类型选择模型,而非仅看通用榜单。


数据来源:赢政指数 WDCD 守约排行榜 | Run #291 · 变化追踪 | 评测方法论