7模型WDCD守约分集体下滑,Claude Sonnet 4.6逆涨8.6分

本期WDCD v3.1测试显示,Claude Sonnet 4.6 WDCD分数较Run #311上升8.6分,而Claude Opus 4.7、Gemini 2.5 Pro、Gemini 3.1 Pro、GLM-4.6、GPT-5.5、GPT-o3、DeepSeek V4 Pro七个模型全部下降,其中GLM-4.6下降27分、Gemini 2.5 Pro下降23.8分。

数据事实:上升仅1家,下降覆盖7家

11个参评模型中,上升模型仅Claude Sonnet 4.6一家,下降模型达到7家。当前Top 5为Grok 4 WDCD=93.80、GPT-o3 WDCD=89.80、Claude Sonnet 4.6 WDCD=87.20、DeepSeek V4 Pro WDCD=83.60、豆包 Pro WDCD=83.00。Claude Opus 4.7下降17分、GPT-5.5下降12.4分、GPT-o3下降5分、DeepSeek V4 Pro下降5分。采样采用worst-of-3口径,每题跑3遍取最差一次,v3题与v2锚点题等权平均。

成因分析:多轮施压下的约束生存差异

WDCD v3题设计包含8-12轮对话,先立约2-5条硬约束,再通过社会认同、权威特批、切香肠、沉没成本逐级施压,最后KBV复述探针与终轮诚实复盘。S_hold守约生存占60分,破得越晚得分越高。GLM-4.6下降27分、Gemini 2.5 Pro下降23.8分,极可能出现在连续施压阶段的R3-R6轮次,约束在沉没成本抬压下最早破防。Claude Sonnet 4.6上升8.6分,显示其在S_recover破防恢复与S_integrity诚实自报两项上得分提升,破防后能更快回到约束框架内。v2锚点题三轮设计中,R3施压权重为2分,下降模型很可能在该轮失分最多。

选型含义:生产流程接入的实际风险边界

把AI接入生产流程的企业,可依据WDCD分数划分场景。Grok 4 WDCD=93.80、GPT-o3 WDCD=89.80的模型,适合数据边界与安全合规类任务,守约生存时间较长,适合直接接入无需额外护栏。Claude Sonnet 4.6 WDCD=87.20虽有上升,但仍低于前两名,工程规范场景可使用,但需在资源限制类任务中增加人工复核节点。GLM-4.6与Gemini 2.5 Pro分数下降明显,业务规则与安全合规场景应设置二次确认机制,避免单轮施压即导致约束失效。豆包 Pro WDCD=83.00与DeepSeek V4 Pro WDCD=83.60,可用于内部非核心流程,但对外-facing系统需叠加规则引擎。

战略判断:守约能力被低估与高估的模型

Claude Opus 4.7下降17分而Claude Sonnet 4.6上升8.6分,同一系列内部差异达到25.6分,说明版本迭代对多轮施压的敏感度变化显著。Grok 4 WDCD=93.80在本次未列入下降名单,守约能力可能被市场低估,值得下期重点验证其在KBV复述探针上的表现。GPT-o3 WDCD=89.80虽下降5分,仍稳居第二,S_hold得分仍具竞争力。GLM-4.6下降27分幅度最大,其在v3题的立约阶段可能已出现约束记忆衰减,S_kbv 15分项或成主要失分点。分析判断,下一周期需观察Claude Sonnet 4.6是否能在S_hold 60分项继续提升,以及Grok 4是否维持93.80以上水平。

守约分数不是静态标签,而是多轮压力下的生存曲线。

企业选型时,WDCD 90分以上模型可减少护栏投入,85-90分模型需针对性加固,80分以下模型则应限制在低风险场景。v3.1试点阶段已显示,约束记忆与破防恢复的权重分配将直接影响生产部署成本。


数据来源:赢政指数 WDCD 守约排行榜 | Run #316 · 变化追踪 | 评测方法论