WDCD v3.1守约测试中,Grok 4以91.04分获得第一,豆包Pro以58.00分位列最后,头部与尾部相差33.04分。这一结果来自11个模型在25道题上的worst-of-3采样,v3题与v2锚点题等权平均得出。
排名格局:R3施压轮决定分差
前两名Grok 4(91.04)和DeepSeek V4 Pro(89.04)在R3得分分别为1.25/2和1.50/2,显著高于中游。Claude Sonnet 4.6(83.72)、GPT-o3(83.40)、Gemini 3.1 Pro(83.36)三者R3得分依次为1.00/2、1.00/2、0.88/2,差距主要来自R2干扰后的R3表现。GPT-5.5 R3仅0.50/2,整体75.04分;豆包Pro R1、R2、R3全为0.00/2,直接拉低至58.00分。
全局满分率49.5%,R3崩溃率12.4%,说明超过一成模型在连续社会认同、权威特批、切香肠、沉没成本四级施压后守约失败。v2锚点题中R3权重最高(2分),因此R3得分直接放大总分差异。
冠军成因:Grok 4在多轮渐进施压下的R3表现
Grok 4 R1=1.00、R2=0.88、R3=1.25/2,v3题S_hold、S_kbv、S_recover、S_integrity四分量平衡。R3阶段面对并行硬约束后仍能维持较高生存率,说明其在KBV复述探针与终轮诚实复盘中表现稳定。DeepSeek V4 Pro R3达到1.50/2,但R2仅0.63,显示其在干扰阶段稍弱于Grok 4。
Claude Sonnet 4.6本期上升8.8分,主要来自R2从低位回升至0.88,R3维持1.00/2。GPT-5.5上升5.0分,但R3仍停留在0.50/2,说明其恢复能力有限。豆包Pro三轮全0,表明在立约阶段即无法建立有效约束记忆。
尾部差距:豆包Pro与Qwen3 Max的约束场景失效
豆包Pro在数据边界、资源限制、业务规则、安全合规、工程规范五类场景下均出现R1即破,S_hold得分接近0。Qwen3 Max R3仅0.63/2,较中游低0.37-0.62分。Gemini 2.5 Pro R3 1.00/2但整体71.96分,显示v3题多轮施压累积效应明显。
这些差距并非随机,v3题设计8-12轮对话,连续施压逐级抬高,R3崩溃率12.4%直接对应尾部模型在真实对话中的守约断裂。
对生产流程接入的选型含义
企业将AI接入高约束场景时,Grok 4与DeepSeek V4 Pro的91分与89分水平可减少额外护栏投入。数据边界与安全合规场景下,R3得分1.25/2以上的模型在沉没成本施压后仍能维持约束,适合直接用于生产。R3低于0.75/2的模型(如GPT-5.5、Qwen3 Max、豆包Pro)在业务规则与工程规范场景需增加独立校验层,否则可能在连续施压中违反硬约束。
Claude Sonnet 4.6与GPT-o3处于83分区间,适合中低风险流程,但资源限制场景仍需监控R2干扰后的恢复表现。
战略判断:守约能力被低估与高估的信号
Grok 4的91.04分与DeepSeek V4 Pro的89.04分差距仅2分,显示顶级模型在v3多轮施压下已形成明显梯队。Claude Sonnet 4.6单期提升8.8分,提示其R2恢复机制可能在下一版本继续优化,值得下期重点验证。GPT-5.5 R3仅0.50/2却仍有5分提升,说明其S_recover与S_integrity分量存在改善空间,但R3施压轮仍是瓶颈。
豆包Pro的-16.0分下滑与全轮0分表现,表明其在当前v3.1题池下守约能力被市场高估。Qwen3 Max 67.68分与中游差距超过15分,同样需要额外护栏才能进入生产。下一期应重点观察R3得分1.00/2以上模型在安全合规场景的S_hold生存曲线。
守约不是模型宣传语,而是R3施压轮后的真实得分。
数据来源:赢政指数 WDCD 守约排行榜 | Run #271 · 总榜排名 | 评测方法论
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接