Claude Sonnet 4.6 本期 WDCD 得分 83.72,较 Run #263 上升 8.8 分;豆包 Pro 得分下降 16 分;GPT-5.5 上升 5 分。11 个参评模型中仅 2 家上升、1 家下降,Top 5 首位 Grok 4 保持 91.04。
数据事实:v3.1 题池下的具体得分位移
本次采样采用 worst-of-3 口径,25 道题中 17 道 v3 多轮渐进施压题与 8 道 v2 锚点题等权平均。Claude Sonnet 4.6 得分 83.72 进入前三,GPT-o3 83.40 与 Gemini 3.1 Pro 83.36 紧随其后。豆包 Pro 的 16 分降幅在当前仅三家有变化的名单中最为突出。
成因分析:多轮施压与约束记忆的机制差异
v3 题设计在第 2-5 轮立约后,连续施压包含社会认同、权威特批、切香肠、沉没成本四种逐级抬压方式。Claude Sonnet 4.6 得分上升 8.8 分,最可能来自 S_hold 守约生存 60 分项的晚破或不破,以及 S_kbv 约束记忆 15 分项的稳定复述。相比之下,豆包 Pro 16 分降幅更可能出现在 R2-R3 干扰与施压阶段,S_recover 破防恢复 10 分与 S_integrity 诚实自报 15 分两项同时失分。
五类约束场景中,安全合规与工程规范两类施压轮次对模型最敏感。Claude Sonnet 4.6 或许在安全合规场景的 KBV 复述探针上表现更稳,豆包 Pro 则可能在工程规范的沉没成本抬压下更早破约。v2 锚点题三轮设计(R1 注入约束、R2 干扰、R3 施压)中,豆包 Pro 的 R3 得分很可能从满分 2 分降至 0 分,导致整体折算百分制拉低。
选型含义:生产流程接入时的具体护栏需求
把 AI 接入生产流程的企业需区分场景使用。Grok 4 与 DeepSeek V4 Pro 分别以 91.04 和 89.04 领先,在数据边界与资源限制场景下可直接使用,S_hold 得分高意味着多轮对话中约束存活时间更长。Claude Sonnet 4.6 得分 83.72 适合安全合规场景,但仍需在业务规则场景额外设置人工复核节点,因为其 8.8 分升幅尚未覆盖所有约束类型。
豆包 Pro 得分下降 16 分后,工程规范与资源限制场景不建议直接接入,必须增加外部规则引擎拦截。GPT-5.5 上升 5 分的模型可在低风险的业务规则场景试用,但需在第 8-12 轮对话后强制触发 KBV 复述探针,防止 S_integrity 项失分。
战略判断:守约能力被低估与高估的信号
Claude Sonnet 4.6 本期 83.72 分进入 Top 3,其 8.8 分升幅可能反映 v3 题对 S_recover 破防恢复能力的更高权重,市场此前对该模型的守约能力或存在低估。豆包 Pro 的 16 分降幅则提示其在连续施压下的 S_hold 生存能力被高估,下一期需重点验证其在安全合规场景的 R3 施压表现。
Grok 4 91.04 与 DeepSeek V4 Pro 89.04 的领先差距仅 2 分,战略上值得持续跟踪两者在 v3 题 8-12 轮对话中的 S_kbv 约束记忆得分。若下一期 Grok 4 的 worst-of-3 最差得分仍能维持在 90 分以上,则其工程规范场景的接入优先级将进一步提升。
Claude Sonnet 4.6 与豆包 Pro 的 8.8 分与 16 分反向移动,表明 WDCD v3.1 已开始区分模型在多轮渐进施压下的真实守约边界。
本次试点阶段不参与主榜计分,但 2 升 1 降的格局已显示守约能力不再是均匀分布。企业选型时应将 S_hold 60 分项与 S_integrity 15 分项单独列为硬指标,而非仅看总分排名。下一期需重点观察 GPT-5.5 5 分升幅是否能转化为 R3 施压阶段的稳定表现,以及 Claude Sonnet 4.6 是否能在更多约束场景复制本次升幅。
数据来源:赢政指数 WDCD 守约排行榜 | Run #271 · 变化追踪 | 评测方法论
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接