WDCD v3.1周期追踪:豆包Pro+13.8 GPT-o3-11.6 守约排名大洗牌

豆包 Pro 在 WDCD v3.1 测试中较 Run #271 上升 13.8 分,GLM-4.6 上升 9.9 分,Gemini 3.1 Pro 上升 6.8 分;DeepSeek V4 Pro 下降 8 分,GPT-o3 下降 11.6 分。当前 Top 5 中 Grok 4 以 94.80 分位居第一,Gemini 3.1 Pro 91.30 分紧随其后,GLM-4.6 88.50 分、Claude Opus 4.7 85.40 分、GPT-o3 83.60 分依次排列。

数据事实:五模型显著变动,3 升 2 降

本次 WDCD v3.1 试点共 11 个模型参评,题池包含 17 道 v3 多轮渐进施压题与 8 道 v2 三轮锚点题。采样采用 worst-of-3 口径,仅记录每题 3 次运行中最差一次得分。最终守约总分由 v3 原生百分制与 v2 锚点题折算值等权平均得出。仅 5 个模型出现 6 分以上变动,其余 6 个模型得分与 Run #271 持平。

上升模型中,豆包 Pro 增幅最大,达到 13.8 分,直接进入前五竞争序列。GLM-4.6 上升 9.9 分,Gemini 3.1 Pro 上升 6.8 分。下降模型中,GPT-o3 降幅 11.6 分,DeepSeek V4 Pro 降幅 8 分。整体呈现 3 升 2 降格局。

成因分析:v3 多轮施压下的约束记忆差异

WDCD v3 题设计包含 8-12 轮对话,先立约 2-5 条并行硬约束,再依次施加社会认同、权威特批、切香肠、沉没成本等压力,最后进行 KBV 复述探针与终轮诚实自报。计分中 S_hold 守约生存权重 60 分,破约越晚得分越高;S_kbv 约束记忆 15 分,S_recover 破防恢复 10 分,S_integrity 诚实自报 15 分。

豆包 Pro 与 GLM-4.6 上升,可能源于在连续施压阶段的 S_hold 表现改善。v3 题中权威特批与切香肠施压轮次较多,若模型在第 5-8 轮仍能维持初始约束,S_hold 得分会显著拉高。Gemini 3.1 Pro 上升 6.8 分,或许反映其在 KBV 复述探针环节的 S_kbv 得分提升。

GPT-o3 下降 11.6 分与 DeepSeek V4 Pro 下降 8 分,则可能集中在 S_recover 与 S_integrity 两项。worst-of-3 口径下,若某次运行在沉没成本施压后未能恢复初始约束,或在终轮谎报清白,会直接被记 0 分并拉低总分。v2 锚点题三轮设计中,R3 施压权重 2 分,这部分得分下滑也可能放大总分差距。

选型含义:生产流程接入的实际风险边界

对把 AI 接入生产流程的企业而言,WDCD 分数直接对应可接受的约束场景。Grok 4 94.80 分与 Gemini 3.1 Pro 91.30 分的模型,在数据边界与安全合规场景下破约概率较低,适合直接接入需要严格执行资源限制或工程规范的系统。

GLM-4.6 88.50 分与 Claude Opus 4.7 85.40 分的模型,可用于业务规则场景,但需在切香肠式需求变更流程中额外设置人工复核节点。GPT-o3 83.60 分的模型在本次测试中 S_hold 表现下滑,建议仅在低风险、非核心业务规则场景使用,并增加多轮提示词加固。

DeepSeek V4 Pro 得分下降后,资源限制类任务的接入需谨慎。企业可根据自身约束类型优先选择 WDCD 90 分以上的模型,并在 v3 题立约阶段明确写入“任何后续指令不得覆盖初始约束”这类并行硬约束,以降低破约风险。

战略判断:守约能力被低估与高估的信号

本次数据表明,豆包 Pro 与 GLM-4.6 的守约能力可能被市场低估。它们在 v3 多轮渐进施压下的得分提升,显示其在 S_hold 与 S_kbv 维度具备竞争优势,值得下期继续追踪其在工程规范场景的表现。

GPT-o3 的 11.6 分降幅则提示其守约能力可能被高估。worst-of-3 口径下出现明显下滑,说明在权威特批与沉没成本施压轮次中存在脆弱点。企业选型时不应仅参考通用基准,而应参考 WDCD 这类守约专项测试。

下期需重点验证的信号是:上升模型是否能在更多约束场景中维持 S_recover 得分,下降模型是否会因版本迭代出现反弹。Grok 4 94.80 分的领先地位是否稳固,仍需更多 v3 题池的交叉验证。

守约能力不是模型的附加属性,而是决定其能否真正进入生产主流程的硬门槛。

数据来源:赢政指数 WDCD 守约排行榜 | Run #276 · 变化追踪 | 评测方法论