WDCD守约榜:Gemini 3.1 Pro 97.7分领跑 Qwen3 Max 70.3分垫底

WDCD v3.1守约测试中,Gemini 3.1 Pro以97.70分位居11个参评模型首位,Qwen3 Max以70.30分垫底,两者相差27.4分。采样采用worst-of-3口径,题池包含17道v3多轮渐进施压题与8道v2锚点题,评分严格按S_hold 60分、S_kbv 15分、S_recover 10分、S_integrity 15分四分量执行。

排名格局:头部集中,尾部断层

前五名WDCD得分均在94.7分以上,Gemini 3.1 Pro 97.70、Grok 4 96.30、GLM-4.6 95.00、GPT-o3 94.80、Claude Opus 4.7 94.70。第六至第七名Gemini 2.5 Pro 93.20与GPT-5.5 92.60仍保持90分以上区间。第八名DeepSeek V4 Pro 88.60开始下滑,第九名豆包 Pro 79.10、第十名Claude Sonnet 4.6 78.60、第十一名Qwen3 Max 70.30形成明显断层。

全局统计显示满分率68.2%,R3崩溃率仅2.7%。这表明多数模型在v2锚点题的R1、R2阶段能维持约束,但在R3施压阶段差异放大。GLM-4.6 R3得0.00/2、GPT-o3 R2得0.00、DeepSeek V4 Pro R2与R3均0.00、Qwen3 Max R3 0.00,说明尾部模型在连续施压下的S_hold得分显著降低。

冠军分析:Gemini 3.1 Pro的约束记忆与恢复机制

Gemini 3.1 Pro在v2锚点题R1=1.00、R2=1.00、R3=2.00/2全满分,结合v3题S_kbv与S_recover高分,推测其在数据边界与安全合规场景中能较好抵抗社会认同与沉没成本施压。成因可能在于其对多条并行硬约束的KBV复述探针响应更稳定,终轮诚实自报得分较高。

对生产流程企业而言,该模型在资源限制与工程规范场景下可直接接入,破防后恢复能力较强,无需额外护栏。但在业务规则场景仍建议保留人工复核,因为S_integrity 15分机制下任何谎报清白都会直接记0。

垫底分析:Qwen3 Max的R3崩溃与S_hold损失

Qwen3 Max WDCD 70.30,v2锚点题R1=1.00、R2=1.00、R3=0.00/2,R3满分损失直接导致总分折算后大幅落后。结合v3题worst-of-3采样,其在连续施压轮次中S_hold 60分部分损失最大,推测在权威特批与切香肠施压下约束记忆衰减更快。

选型含义明确:在安全合规与数据边界场景,该模型不宜直接用于生产流程,需额外增加输出过滤护栏。否则一旦进入多轮对话,破防后恢复概率低,S_recover得分难以弥补。

头部梯队 vs 尾部差距的机制差异

头部模型(前五)在R3阶段平均得分1.6/2以上,尾部模型(后三)平均得分0.67/2。差距主要集中在v3题的连续施压阶段与v2锚点题的R3施压。GLM-4.6与Qwen3 Max的R3得0,说明其在沉没成本抬压下的S_hold生存时间较短。

战略判断:Claude Opus 4.7本期94.70分且R3满分,守约能力可能被市场低估;Claude Sonnet 4.6 78.60分与同系列差距13分,R2与R3表现不稳定,信号值得下期验证。DeepSeek V4 Pro 88.60分在R2、R3均0,工程规范场景接入风险较高。

与上期对比数据支持的判断包括:Gemini 2.5 Pro上升22.2分、豆包 Pro上升11.2分,表明其v3题S_recover与S_integrity得分改善;Claude Sonnet 4.6下降13.0分,R2阶段约束记忆可能出现问题。

对企业选型,90分以上模型适合安全合规与数据边界场景直接接入,80-90分区间模型需在资源限制场景增加护栏,70分以下模型仅建议用于低风险业务规则测试。所有判断均基于本期WDCD得分与R1-R3分项数据推出。

守约能力不是模型参数的附属品,而是生产流程能否长期稳定的核心护城河。

数据来源:赢政指数 WDCD 守约排行榜 | Run #306 · 总榜排名 | 评测方法论