Grok 4以WDCD 93.21分位居本次守约测试首位,Qwen3 Max以74.31分排在11位,两者相差18.9分。
排名格局与核心数据
本次WDCD v3.1测试共11个模型参与,题池29道题采用worst-of-3采样。Grok 4在v3多轮渐进施压题与v2锚点题折算后得分最高,其R1=1.00、R2=1.00、R3=1.25/2。GLM-4.6紧随其后得91.38分,R3达到1.50/2。DeepSeek V4 Pro 87.97分、GPT-o3 86.93分、Gemini 3.1 Pro 85.72分构成第二梯队。尾部Qwen3 Max R3仅0.63/2,全局R3崩溃率9.1%,满分率58%。
冠军成因:R3施压阶段的约束生存
Grok 4在v3题的8-12轮对话中,立约阶段建立的硬约束在社会认同、权威特批、切香肠、沉没成本逐级抬压下,S_hold守约生存得分最高。R3施压轮次直接决定60分权重,Grok 4 R3得分1.25/2,高于Claude Opus 4.7的0.75/2和GPT-5.5的0.88/2。这表明其在工程规范与安全合规场景的连续施压下,破防时间更晚,S_recover恢复能力与S_integrity诚实自报也维持较高水平。
垫底模型的机制短板
Qwen3 Max R3仅0.63/2,在KBV复述探针与终轮诚实复盘环节失分明显。11个模型中,R3崩溃率9.1%集中在尾部三名。豆包 Pro R3 1.13/2却整体仅75.62分,说明其v3题S_kbv约束记忆15分项可能偏弱。Claude Sonnet 4.6较上期下降5.0分,R2从可能更高水平降至0.88,显示三轮锚点题干扰阶段稳定性下降。
头部梯队与尾部差距的选型含义
对把AI接入生产流程的企业而言,Grok 4与GLM-4.6的守约数据意味着在数据边界与资源限制场景可直接使用,安全合规场景需保留人工复核。R3得分低于1.00的模型如GPT-o3(0.63/2)、Qwen3 Max(0.63/2),在业务规则连续施压下破防概率更高,建议增加外部护栏或多模型投票。Gemini 2.5 Pro R3 1.25/2但总分仅77.48,说明v3题S_hold权重拉低整体表现,生产部署时应针对沉没成本抬压单独测试。
战略判断:能力被低估与待验证信号
从R3得分与总分对应关系看,Grok 4的守约能力可能被市场低估,其1.25/2的R3表现与93.21总分匹配度高。GLM-4.6 R3 1.50/2却总分91.38,或许在S_integrity诚实自报15分项存在扣分空间,值得下期验证。Claude Opus 4.7 R2仅0.50,显示干扰阶段约束记忆弱于同系列Sonnet 4.6,战略上不宜在多轮渐进施压场景首选。豆包 Pro较上期上升7.5分,R3 1.13/2的改善可能来自v2锚点题优化,但仍需观察是否稳定。
全局统计显示58%模型在部分约束场景达到满分,说明当前v3.1题池对头部模型已形成有效区分。企业选型时,优先考虑R3得分1.00以上的模型,可降低工程规范场景的合规风险。尾部模型在安全合规与业务规则场景的S_hold得分偏低,需额外部署规则引擎或人工审核节点。
守约能力不是模型参数的附属品,而是生产部署的隐形门槛。
下期测试若增加更多资源限制类场景,R3得分差异或进一步放大头部与尾部差距。
数据来源:赢政指数 WDCD 守约排行榜 | Run #311 · 总榜排名 | 评测方法论
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接