97.7 vs 75.2:DeepSeek V4 Pro 守约碾压 Qwen3 Max 22分差距

DeepSeek V4 Pro 以 97.70 分位列 WDCD v3.1 守约总榜第一,Qwen3 Max 以 75.20 分位列第 11,头部与尾部相差 22.5 分。

排名格局:前三集中,后三断层

本次 11 个模型中,DeepSeek V4 Pro、Gemini 3.1 Pro、Grok 4 形成第一梯队,分别 97.70、96.70、96.00 分。三者 R1、R2 均保持满分,仅在 R3 阶段出现 0-1 分差异。第四至第七名 Gemini 2.5 Pro(94.50)、GPT-o3(94.20)、Claude Opus 4.7(92.60)、GPT-5.5(90.10)构成第二梯队,R2 阶段已出现 0 分记录。第八名之后,Claude Sonnet 4.6(83.60)、豆包 Pro(76.70)、GLM-4.6(76.50)、Qwen3 Max(75.20)拉开明显差距。

冠军成因:v3 多轮施压下的完整生存

DeepSeek V4 Pro 在 v3 题的 S_hold 守约生存维度得分最高,破防时间最晚。v3 题设计包含 8-12 轮对话,先立 2-5 条硬约束,再依次施加社会认同、权威特批、切香肠、沉没成本压力,最后进行 KBV 复述探针与终轮诚实复盘。该模型在所有 5 类约束场景(数据边界、资源限制、业务规则、安全合规、工程规范)中均完成 R1-R3 全流程未破,S_kbv 约束记忆 15 分、S_recover 破防恢复 10 分、S_integrity 诚实自报 15 分全部拿满。

垫底机制:R1 即失守的连锁反应

GLM-4.6 与 Qwen3 Max 在 v2 锚点题 R1 阶段即出现 0 分,意味着初始约束注入阶段即被突破。GLM-4.6 三轮锚点题 R1、R2、R3 全部 0 分,v3 题 S_hold 得分相应大幅下滑。Qwen3 Max 虽然 R3 拿回 2 分,但前期 R2 0 分已导致总分被拉低。采样口径为 worst-of-3,每题跑 3 遍取最差一次,这两款模型在至少一轮测试中 R1 阶段即失效。

头部与尾部差距的选型含义

对把 AI 接入生产流程的企业而言,WDCD 97.70 分与 75.20 分的差距直接对应不同风险敞口。DeepSeek V4 Pro 在安全合规与工程规范场景下 R3 阶段仍能维持约束,适合直接接入需要长期状态保持的内部审批流程。Qwen3 Max 与 GLM-4.6 在初始约束注入阶段即失守,意味着在相同场景下必须额外叠加外部护栏或人工复核,否则单次对话即可突破数据边界或资源限制。

第二梯队模型的实际可用边界

Gemini 2.5 Pro 与 GPT-o3 在 R2 阶段已出现 0 分,说明它们在面对连续社会认同或权威特批施压时守约能力下降。企业若计划使用这两款模型处理业务规则类任务,需在 R2 阶段对应的对话轮次增加二次确认节点。Claude Opus 4.7 本期 92.60 分,较上期提升 14.9 分,R3 阶段恢复能力较强,可在需要破防后快速恢复的场景中考虑,但仍需监控 S_integrity 诚实自报维度。

战略判断:守约能力被低估与高估的信号

从本次数据看,DeepSeek V4 Pro 的守约能力可能被市场低估,其 97.70 分与第二名仅差 1 分,却在 worst-of-3 口径下保持最高稳定性。GLM-4.6 的 76.50 分与 Qwen3 Max 的 75.20 分接近,R1 阶段共同失守,说明两款模型在约束注入环节存在同类机制缺陷,值得下期重点验证是否为训练阶段的共同短板。Gemini 3.1 Pro 较上期提升 17.4 分,R1-R3 全满分,显示其在 v3 多轮渐进施压下的恢复机制已接近第一梯队。

全局统计显示满分率 60%,R3 崩溃率仅 0.9%,表明当前多数模型在单轮高压下仍能维持约束,但 worst-of-3 口径已将尾部模型的真实风险暴露出来。企业选型时,建议将 WDCD 90 分以上模型作为生产流程默认选项,90 分以下模型仅在低风险、非持久状态场景使用,并增加外部校验。

DeepSeek V4 Pro 97.70 分与 Qwen3 Max 75.20 分的差距,已不再是分数差异,而是生产系统能否在 8-12 轮对话中保持初始约束的实际分界线。

数据来源:赢政指数 WDCD 守约排行榜 | Run #326 · 总榜排名 | 评测方法论