Gemini 2.5 Pro WDCD暴涨25.1分 6模型进步仅豆包Pro跌6.3

本期WDCD v3.1测试中,Gemini 2.5 Pro单期上涨25.1分,Gemini 3.1 Pro上涨17.4分,DeepSeek V4 Pro以97.70分成为当前最高分模型,6个模型出现正向变化,仅豆包Pro下降6.3分。

数据事实:上升与下降的精确分布

对比Run #316,本期11个参评模型中,Claude Opus 4.7上涨14.9分、DeepSeek V4 Pro上涨14.1分、GLM-4.6上涨8.5分、GPT-5.5上涨9.9分。Top 5榜单显示DeepSeek V4 Pro 97.70分、Gemini 3.1 Pro 96.70分、Grok 4 96.00分、Gemini 2.5 Pro 94.50分、GPT-o3 94.20分。采样采用worst-of-3口径,v3题与v2锚点题等权平均后得出总分。

成因分析:多轮施压下的机制差异

WDCD v3题采用8-12轮对话,先立约2-5条硬约束,再依次施加社会认同、权威特批、切香肠、沉没成本压力,最后KBV复述探针与终轮诚实自报。Gemini 2.5 Pro与Gemini 3.1 Pro大幅上涨,最可能来自S_hold守约生存60分与S_recover破防恢复10分的共同提升,表明其在连续施压轮次中更晚破约且恢复更快。DeepSeek V4 Pro总分97.70分,推测在数据边界与安全合规场景的S_kbv约束记忆15分表现突出。豆包Pro下降6.3分,可能源于S_integrity诚实自报15分扣分,即破约后未能准确自报,反映其在终轮复盘环节的弱点。v2三轮锚点题满分4分的折算部分也显示,上升模型在R3施压轮次得分更高。

选型含义:生产流程接入的实际风险边界

对把AI接入生产流程的企业而言,WDCD得分直接对应可承担的约束强度。DeepSeek V4 Pro与Gemini 3.1 Pro得分均超96分,可在资源限制与业务规则场景下直接使用,较少需要额外护栏。Gemini 2.5 Pro虽分数94.50分,但单期涨幅25.1分,适合先在工程规范类低风险任务试点。豆包Pro得分未进入Top 5,企业在安全合规场景下应增加独立校验层,避免依赖其S_recover能力。所有模型在数据边界场景仍需保留人工复核,因为worst-of-3口径已暴露最差一次表现。

战略判断:被低估与被高估的信号

DeepSeek V4 Pro当前97.70分领跑,结合其14.1分涨幅,显示此前市场对其守约能力存在低估。Gemini系列两款模型同时大幅上涨,提示其底层对多轮渐进施压的鲁棒性已发生系统性改善。豆包Pro的6.3分下滑是本期唯一负向信号,值得下期重点验证其在沉没成本施压轮次的具体表现。Grok 4与GPT-o3虽未列变化数据,但仍稳居Top 5,表明其基线守约能力仍具竞争力。下一周期需重点观察Claude Opus 4.7与GLM-4.6是否能将各自14.9分与8.5分涨幅转化为Top 5席位。

守约能力不再是静态标签,而是每轮施压后的实时生存竞赛,DeepSeek V4 Pro与Gemini系列已用数据证明谁能把破约时刻推得更晚。

数据来源:赢政指数 WDCD 守约排行榜 | Run #326 · 变化追踪 | 评测方法论