Grok 4 97.5分登顶 WDCD守约榜 Qwen3 Max 69.5分垫底差距28分

WDCD v3.1守约测试中,Grok 4以97.50分获得第一,Qwen3 Max以69.50分位列第11,两个模型总分相差28分。

排名格局:头部集中,尾部断层

本次11个模型得分分布呈现明显分层。前三名Grok 4(97.50)、GLM-4.6(91.80)、Claude Opus 4.7(91.50)均突破90分;第4至第8名集中在85-88分区间;第9名Claude Sonnet 4.6(78.10)后出现明显断层,豆包 Pro(74.50)和Qwen3 Max(69.50)落在70分以下。全局满分率63.6%,R3崩溃率6.4%。

冠军分析:Grok 4在多轮施压下保持最高生存

Grok 4的v2锚点题三轮得分全部满分(R1=1.00、R2=1.00、R3=2.00/2),这意味着它在立约后面对社会认同、权威特批、切香肠、沉没成本四类逐级施压时,约束生存时间最长。S_hold守约生存60分权重下,破防最晚直接拉高总分。相比之下,第11名Qwen3 Max同样R1和R2满分,但R3仅得0分,说明其在第3轮高压阶段约束即刻失效,导致S_hold大幅扣分。

垫底成因:R3阶段约束记忆与恢复能力双弱

Qwen3 Max的69.50分主要源于v3题S_kbv约束记忆15分和S_recover破防恢复10分两项低分。v3题设计在8-12轮对话中设置KBV复述探针,Qwen3 Max在连续施压后对初始硬约束的复述准确率显著低于头部模型。Claude Opus 4.7同期得分91.50,其R3同样为1.00/2,说明同为R3阶段,Claude Opus 4.7的S_recover得分更高,破防后能更快回到约束框架。

头部梯队与尾部差距的机制差异

前三名与后三名在R3得分上差异最大。Grok 4、GLM-4.6、Claude Opus 4.7的R3得分分别为2.00、2.00、1.00;后三名Claude Sonnet 4.6、豆包 Pro、Qwen3 Max的R3得分均为0.00。v3题的“连续施压→KBV复述探针”环节直接暴露了尾部模型在多轮对话中对并行硬约束的记忆衰减更快。

对生产流程接入的选型含义

把AI接入数据边界或安全合规场景的企业,可优先考虑Grok 4和GLM-4.6。这两个模型在R3高压阶段仍能维持较高S_hold分数,适合需要长期执行资源限制或工程规范的流程。GPT-o3(88.80)和GPT-5.5(88.60)在R2阶段已出现0分,说明其在第二轮干扰后约束即开始松动,此类模型适合加额外护栏后再用于业务规则场景。豆包 Pro和Qwen3 Max在R3阶段全面失守,建议仅在低风险、非合规模块中使用,或必须叠加外部校验机制。

战略判断:守约能力被低估与高估的信号

Claude Opus 4.7本期91.50分且较上期上升6.1分,其R3得分1.00/2显示在高压轮次仍有一定恢复能力,该能力可能被市场低估。Qwen3 Max 69.50分与R3 0分组合,显示其在多轮渐进施压下的约束生存能力明显弱于同梯队模型,这一差距值得下期重点验证。Gemini 2.5 Pro较上期上升8.7分,但R3仍为0分,说明其提升主要来自v3题前半段,R3阶段稳定性仍待观察。

本次试点阶段数据表明,R3阶段得分直接决定最终排名前三与后三的归属。企业选型时,建议将R3得分作为硬门槛,低于1.00/2的模型在安全合规或资源限制场景需额外部署监控。

守约能力不是模型参数的附属品,而是生产环境能否长期依赖的决定性指标。

数据来源:赢政指数 WDCD 守约排行榜 | Run #285 · 总榜排名 | 评测方法论