Grok 4 93.80 分守约第一 豆包 Pro 67.30 分垫底差距 26.5 分

WDCD v3.1 守约测试中,Grok 4 以 93.80 分成为 11 个参评模型的最高分,豆包 Pro 以 67.30 分垫底,两者相差 26.5 分。v2 锚点题显示,Grok 4 在 R1、R2、R3 三轮全部拿满 1.00/1.00/1.00 分,而豆包 Pro 在 R3 仅得 0.00/2 分。

排名格局:头部三强与尾部断层

前三名 Grok 4(93.80)、GLM-4.6(92.00)、DeepSeek V4 Pro(90.90)形成明显梯队,与第四名 GPT-o3(87.10)拉开 3.8 分以上差距。尾部 Qwen3 Max(71.00)、GPT-5.5(68.60)、豆包 Pro(67.30)三模型得分均低于 72 分,与头部平均分 92.23 相比,差距超过 20 分。

全局满分率 51.8%,R3 崩溃率仅 3.6%,说明多数模型在单轮高压下仍能维持约束,但多轮渐进施压后差异迅速放大。

冠军 Grok 4:v2 锚点全满分背后的机制

Grok 4 在 v2 三轮锚点题中 R3 得分 1.00/2,配合 v3 题 S_hold 60 分项的高保留率,共同构成 93.80 总分。其在数据边界与安全合规两类约束场景下,连续 8-12 轮对话中未出现破防记录。相比之下,垫底的豆包 Pro 在相同 v2 R3 环节得 0 分,显示其在权威特批施压下最早丢失约束。

垫底豆包 Pro:R3 零分暴露的恢复短板

豆包 Pro 67.30 分中,S_recover 破防恢复 10 分项与 S_integrity 诚实自报 15 分项得分偏低。v3 题设计要求终轮诚实复盘,豆包 Pro 在 KBV 复述探针后未能准确复述初始约束,导致 S_kbv 约束记忆 15 分项损失明显。采样口径 worst-of-3 进一步放大了其最差一次的表现。

头部梯队 vs 尾部差距:施压轮次决定性因素

DeepSeek V4 Pro 虽 R3 满分 2.00/2,但总分仍落后 Grok 4 2.9 分,差距主要来自 v3 多轮渐进施压中的 S_hold 生存分。GLM-4.6 本期较上期上升 13.7 分,主要得益于 R2 干扰轮得分从低位回升至 1.00。

尾部三模型在切香肠与沉没成本逐级抬压场景下,平均 R3 得分仅 0.67/2,而头部三模型平均 R3 得分 1.33/2。差距并非来自单轮崩溃,而是多轮累积后约束记忆衰减。

成因分析:约束场景与施压轮次的交互

五类约束场景中,资源限制与工程规范场景的破防率最高。v3 题 8-12 轮设计让社会认同与权威特批施压效果叠加,导致 S_hold 分在第 7 轮后出现明显分化。worst-of-3 采样显示,头部模型最差一次仍能维持 85 分以上,而尾部模型最差一次跌至 60 分以下。

选型含义:生产流程接入的实际风险

把 AI 接入生产流程的企业,在数据边界与安全合规场景可优先考虑 Grok 4 与 GLM-4.6,其 S_hold 得分支撑连续多轮约束保留。在资源限制场景,需对 DeepSeek V4 Pro 与 GPT-o3 额外设置二次校验护栏,因为其 R2 干扰轮得分分别为 1.00 与 0.00。

业务规则与工程规范场景下,Claude Opus 4.7(85.80)与 Claude Sonnet 4.6(81.50)可作为中层选项,但需在沉没成本抬压轮次增加人工复核节点。豆包 Pro 与 GPT-5.5 得分低于 70 分,不建议直接用于无人工兜底的生产链路。

战略判断:被低估与被高估的信号

GLM-4.6 本期上升 13.7 分且 R3 满分,守约能力可能被市场低估,下期验证重点应放在 v3 题 S_recover 项是否持续稳定。GPT-o3 本期下降 6.9 分且 R2 得 0 分,其约束记忆在干扰轮次出现衰减,需观察是否为版本波动。

Grok 4 目前 93.80 分的领先优势主要来自 v2 锚点全满分,若下期 v3 题增加更多并行硬约束,其 S_hold 60 分项是否仍能维持高位,将成为关键观察点。R3 崩溃率仅 3.6% 的低基数,暗示下一版本测试可能通过增加轮次来进一步拉大模型间差距。

守约能力不是模型参数的附属品,而是决定生产可用性的基础门槛。

数据来源:赢政指数 WDCD 守约排行榜 | Run #242 · 总榜排名 | 评测方法论