Claude Sonnet 4.6 暴涨15分 GLM-4.6 暴跌15.3 WDCD守约两极分化

Claude Sonnet 4.6在本期WDCD v3.1测试中较Run #227上涨15分,GLM-4.6同期下跌15.3分,这一正负对称变化成为11个参评模型中最突出的守约波动信号。

数据事实:3升4降的精确分布

本次采样采用worst-of-3口径,覆盖v3.1题池的17道渐进施压题与8道v2锚点题。上升模型仅3个,下降模型4个,具体数值为Claude Opus 4.7上涨5.1分、Claude Sonnet 4.6上涨15分、Gemini 3.1 Pro上涨6.5分;DeepSeek V4 Pro下跌9.7分、豆包 Pro下跌6.8分、GLM-4.6下跌15.3分、Grok 4下跌7.1分。当前Top 5中GPT-o3保持94.00分首位,Grok 4以87.90分居第二,Claude Opus 4.7 87.60分第三,Gemini 3.1 Pro 87.30分第四,DeepSeek V4 Pro 84.30分第五。

成因分析:施压轮次与约束场景的机制差异

WDCD v3.1设计包含立约后连续8-12轮社会认同、权威特批、切香肠、沉没成本逐级抬压,以及KBV复述探针与终轮诚实自报。Claude Sonnet 4.6的15分涨幅最可能来自S_hold守约生存60分项的晚破防表现,即在多轮切香肠施压下仍维持约束边界。相比之下,GLM-4.6的15.3分跌幅更可能集中于S_recover破防恢复10分与S_integrity诚实自报15分项,提示其在v2三轮锚点题的R3施压阶段更容易出现约束记忆丢失后无法恢复的情况。

五类约束场景中,安全合规与工程规范场景的施压梯度最陡。Claude Sonnet 4.6的得分提升或许反映其对权威特批类干扰的抵抗力增强,而GLM-4.6的下滑则可能源于资源限制场景下的沉没成本抬压失效。Grok 4虽仍居第二,但7.1分下跌与DeepSeek V4 Pro的9.7分下跌共同指向数据边界场景的S_kbv约束记忆15分项脆弱。

选型含义:生产流程接入的实际风险边界

对把AI接入生产流程的企业而言,GPT-o3的94.00分意味着在安全合规场景下可直接使用,S_hold得分高表明其在多轮业务规则施压中破防概率较低。Grok 4与Claude Opus 4.7并列87分区间,适合资源限制场景但需在工程规范环节额外设置二次确认护栏。Gemini 3.1 Pro 87.30分与DeepSeek V4 Pro 84.30分的差距显示,后者在数据边界场景的守约稳定性已低于前者6分,企业若计划调用DeepSeek V4 Pro处理敏感数据,应在v3题对应的KBV复述探针位置增加人工复核节点。

Claude Sonnet 4.6的15分上涨提示其可用于业务规则场景的初步试点,但GLM-4.6的15.3分下跌则明确警示:任何依赖其长期约束记忆的生产链路都需立即加装外部状态机,避免沉没成本抬压导致的累积性违规。

战略判断:被低估与被高估的守约信号

Claude Sonnet 4.6的15分涨幅与Claude Opus 4.7的5.1分涨幅形成内部差异,表明Sonnet版本在v3.1的连续施压轮次中可能已获得针对性优化,这一信号值得下期v3.1题池重点验证其S_recover表现。GLM-4.6的15.3分下跌幅度超过Grok 4的7.1分,显示其守约能力被市场相对高估,企业选型时应下调对其工程规范场景的信任权重。

GPT-o3以94.00分领先第二名6.1分,领先优势在本次数据中最为稳固。DeepSeek V4 Pro虽仍列第五,但9.7分下跌已使其与Gemini 3.1 Pro的差距扩大至3分,未来若继续在安全合规场景失分,将面临出Top 5风险。

守约能力的分化不是模型大小的简单函数,而是对多轮抬压机制的真实响应,本期数据已清晰标出谁在退步。

数据来源:赢政指数 WDCD 守约排行榜 | Run #233 · 变化追踪 | 评测方法论