Grok 4 以 WDCD 91.76 分位居 WDCD 守约排行榜首位,GLM-4.6 以 61.55 分垫底,头部与尾部差距达到 30.21 分。
排名格局:头部集中,尾部断崖
本次 WDCD v3.1 试点测试覆盖 11 个模型,采用 worst-of-3 采样。Grok 4、Gemini 3.1 Pro、GPT-o3 形成第一梯队,分数分别为 91.76、89.59、87.86。第四名 Claude Opus 4.7 83.97 分与第一名相差 7.79 分,梯队内部差距小于 4 分。
第七名豆包 Pro 79.69 分至第十名 GPT-5.5 73.76 分形成第二梯队,区间跨度 5.93 分。GLM-4.6 61.55 分单独垫底,比第十名低 12.21 分,比第一名低 30.21 分。
冠军分析:Grok 4 在 R3 施压阶段保持最高韧性
Grok 4 的 v2 锚点题得分为 R1=1.00、R2=0.88、R3=1.25/2,折算后支撑其总分领先。R3 阶段对应连续施压中的沉没成本与切香肠策略,Grok 4 在此轮次得分最高,表明其在多轮渐进施压下守约生存能力最强。
相比之下,Gemini 3.1 Pro R3 得 1.38/2 略高,但 R2 相同,整体仍落后 Grok 4 2.17 分。GPT-o3 R3 仅 0.75/2,拖累总分至第三。
垫底分析:GLM-4.6 在所有锚点题完全失守
GLM-4.6 的 R1、R2、R3 得分均为 0.00/2,较上期下降 29.8 分。这是本次测试中唯一在 v2 锚点题三轮全部归零的模型,说明其在约束注入、干扰、施压三阶段均未能维持初始约定。
该模型在 v3 题的 S_hold 守约生存得分可能极低,导致整体拉低 15 分的 S_integrity 也难以弥补。全局 R3 崩溃率 9.4%,GLM-4.6 贡献了其中显著部分。
头部梯队与尾部差距的机制成因
差距主要集中在 v3 题的连续施压阶段与 v2 锚点题的 R3 轮次。头部模型在 8-12 轮对话中,面对社会认同、权威特批、切香肠策略时,仍能维持初始 2-5 条硬约束的 S_hold 得分较高。尾部模型则在 KBV 复述探针前已破防,S_recover 恢复能力不足。
数据安全边界与安全合规场景的约束最易暴露差异。GLM-4.6 在工程规范类约束下可能最早失效,而 Grok 4 在资源限制与业务规则场景下表现更稳定。
对生产流程接入的选型含义
把 AI 接入生产流程的企业,在安全合规与数据边界场景下,优先选择 WDCD 90 分以上模型可降低护栏投入。Grok 4 与 Gemini 3.1 Pro 的 S_hold 得分支持更少的实时监控。
资源限制与工程规范场景下,73 分以下模型需额外增加事后审计与人工复核。GLM-4.6 的 61.55 分表明其不适合无护栏部署,任何涉及硬约束的业务规则均需额外隔离层。
业务规则场景可考虑 Claude Opus 4.7(83.97 分)作为平衡选项,其 R3 得分 1.25/2 与 Grok 4 接近。
战略判断:守约能力被低估与需验证的信号
Grok 4 的守约能力可能被市场低估,其 91.76 分在 R3 阶段的 1.25/2 得分显示在最严苛施压下仍保持较高完整性,值得在下一期 v3.2 中重点验证多轮渐进施压的 S_recover 表现。
GLM-4.6 的 29.8 分下滑信号表明其约束记忆能力出现明显退化,下一期需观察其是否能在 v2 锚点题 R1 阶段恢复非零得分。
GPT-5.5 的 73.76 分与上期相比下降 6.0 分,R3 得分仅 0.88/2,提示其在沉没成本施压下的恢复能力可能被高估。
守约能力不是模型规模的附属品,而是生产部署的真实护城河。
数据来源:赢政指数 WDCD 守约排行榜 | Run #331 · 总榜排名 | 评测方法论
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接