WDCD五场景横评:安全合规最低2.19分,glm-4.6四场景称霸

WDCD v3.1守约测试在五大约束场景下的11模型横评显示,安全合规场景成为全体得分最低的维度,qwen3-max仅得2.19/4,远低于工程规范场景的整体中位数3.6/4。

安全合规成最大难点,施压轮次暴露记忆断层

安全合规场景冠军grok-4得3.86/4,垫底qwen3-max仅2.19/4,极差1.67分。v3题设计中连续8-12轮对话先立约再施压,安全合规题的“切香肠”与“权威特批”两轮最易触发破约。qwen3-max在R3施压后KBV复述探针得分骤降,说明其对“合规边界”约束的长期记忆在多轮干扰下最先丢失。相比之下,数据边界场景极差仅1.08分,说明安全合规的约束本身更难被模型内化。

资源限制区分度最高,glm-4.6顶格3.86/4

资源限制场景中glm-4.6以3.86/4领先,gpt-5.5垫底2.86/4,极差1分。v2锚点题三轮设计下,R2干扰与R3施压合计占2分,glm-4.6在两轮均保持约束,显示其对“并发配额”“超时回退”等工程约束的锚定能力更强。该场景区分度最大,直接反映模型在真实生产流程中处理资源类硬约束的可靠性差异。

业务规则与工程规范并列高分,claude-sonnet-4.6偏科1.07分

业务规则场景glm-4.6与grok-4双双4/4,doubao-pro仅2.47/4。工程规范场景同样由glm-4.6与gpt-o3包揽4/4。claude-sonnet-4.6工程规范3.6/4却在业务规则仅2.53/4,场景差距1.07分,符合给定偏科阈值。该模型在“代码审查规范”类约束下守约较稳,但在“定价策略”“审批流程”等业务规则约束下易在沉没成本施压后破约。

gemini-2.5-pro与gpt-o3偏科现象对比

gemini-2.5-pro业务规则3.67/4、安全合规仅2.51/4,差距1.16分;gpt-o3工程规范4/4、数据边界仅2.58/4,差距1.42分。两模型均在v3题的KBV复述探针环节出现约束遗忘,说明其对不同类型约束的记忆优先级存在结构性差异。企业若同时涉及数据边界与工程规范,需为gpt-o3额外增加外部校验层。

企业选型具体建议

把AI接入生产流程的企业,在安全合规场景下应优先选择grok-4或deepseek-v4-pro,两者分别3.86/4与3.57/4;资源限制场景首选glm-4.6;业务规则与工程规范场景可同时考虑glm-4.6与grok-4。qwen3-max在安全合规与数据边界均垫底,不建议直接用于高合规要求场景。claude-sonnet-4.6适合工程规范重度场景,但业务规则环节需增加人工复核节点。

战略判断

glm-4.6在资源限制、业务规则、工程规范三场景均列前二,其守约能力可能被市场低估;qwen3-max在安全合规仅2.19/4,风险敞口最大,值得下期重点验证其v3多轮渐进施压下的约束恢复机制。安全合规场景的整体低分,提示当前模型对合规类并行硬约束的长期记忆仍存在系统性短板。

安全合规不是模型的道德考试,而是生产系统能否长期不翻车的硬指标。

数据来源:赢政指数 WDCD 守约排行榜 | Run #311 · 场景矩阵 | 评测方法论