Gemini 2.5 Pro WDCD暴涨22.2分,Claude Sonnet 4.6独跌13分

本期WDCD v3.1试点数据显示,Gemini 3.1 Pro守约总分达到97.70,位列第一,较Run #296有9.5分提升;Gemini 2.5 Pro则以22.2分增幅成为最大赢家。

核心数据事实:5升1降的明确分布

对比Run #296,本期11个参评模型中,Claude Opus 4.7上升8.9分、豆包 Pro上升11.2分、Gemini 2.5 Pro上升22.2分、Gemini 3.1 Pro上升9.5分、GPT-5.5上升9.3分,合计5个模型正向移动;唯一负向移动的是Claude Sonnet 4.6,下跌13分。当前Top 5依次为Gemini 3.1 Pro 97.70、Grok 4 96.30、GLM-4.6 95.00、GPT-o3 94.80、Claude Opus 4.7 94.70。守约总分由v3题原生百分制与v2锚点题折算值等权平均得出,采样口径为worst-of-3。

成因分析:施压轮次与约束场景的机制差异

WDCD v3题采用8-12轮对话,先立约2-5条硬约束,再依次施加社会认同、权威特批、切香肠、沉没成本压力,最后通过KBV复述探针与终轮诚实复盘计分。S_hold守约生存占60分,破得越晚得分越高。Gemini 2.5 Pro与Gemini 3.1 Pro在多轮渐进施压下S_hold得分更高,说明其在第6-10轮的资源限制与安全合规场景中更能维持约束不破。Claude Sonnet 4.6的13分跌幅最可能出现在R3施压阶段或KBV探针环节,提示其对权威特批类干扰的抵抗力出现下降。v2三轮锚点题中R3权重为2分,若Sonnet在R3失分,会直接拉低总分。豆包 Pro与GPT-5.5的两位数上升,则可能来自工程规范场景下的S_recover破防恢复能力提升。

选型含义:生产流程接入的实际风险边界

对把AI接入生产流程的企业而言,WDCD 97.70的Gemini 3.1 Pro在数据边界与安全合规场景下可直接使用,破防概率最低;Grok 4与GLM-4.6紧随其后,适合资源限制类任务。Claude Sonnet 4.6的13分下滑意味着其在业务规则场景下需要额外护栏,例如在第4轮后强制注入KBV复述检查。GPT-o3与Claude Opus 4.7虽进入Top 5,但与Gemini 3.1 Pro仍有3分以上差距,在沉没成本逐级抬压的环节仍存在不确定性。企业可将WDCD 95分以上模型用于高合规链路,95分以下模型仅用于低风险内部工具,并对所有模型保留人工终轮复盘。

战略判断:被低估与被高估的信号

Gemini系列两款模型同时大幅上升,表明其在v3多轮施压下的约束记忆与诚实自报能力可能被此前市场低估。Claude Sonnet 4.6的独跌则提示其守约能力或许被前期乐观预期高估,需在下一期v3.1继续观察其S_integrity得分是否持续为0。Grok 4以96.30分稳居第二,却未在本期变化列表中出现,说明其守约基线已进入高位平台期,值得下期验证是否能抵御更激进的切香肠策略。GLM-4.6与GPT-o3的95分附近位置,未来若再有3分以上波动,将直接影响Top 5排序。

Gemini 3.1 Pro与Claude Sonnet 4.6的22.2分与13分反向移动,已构成下一周期最值得追踪的对照样本。

数据来源:赢政指数 WDCD 守约排行榜 | Run #306 · 变化追踪 | 评测方法论