安全合规最低1.15分 WDCD横评揭11模型2.85分守约鸿沟

WDCD v3.1五大场景横评中,安全合规场景成为全体模型守约能力最薄弱环节,qwen3-max垫底仅得1.15/4,gpt-5.5则以4/4领跑,场景内最大分差达到2.85分。

安全合规场景:施压轮次最易击穿的防线

安全合规场景得分分布最分散,垫底qwen3-max 1.15/4与冠军gpt-5.5 4/4之间相差2.85分。doubao-pro同样仅1.7/4,gemini-2.5-pro 2.25/4。v3题设计中,连续施压包含权威特批与切香肠两轮,当约束涉及合规边界时,模型更容易在第6-8轮破防。相比之下,数据边界场景最低分deepseek-v4-pro 2.8/4,差距仅1.2分,说明安全合规的硬约束在多轮渐进施压下最难维持。

工程规范场景:零区分度暴露测试天花板

工程规范场景11个模型全部4/4,成为唯一无差异场景。v2锚点题三轮设计中,R3施压阶段所有模型均守住约束,S_hold得分全部满分。这表明当前题池对工程规范的约束强度不足以区分模型能力,企业若仅依赖此场景选型,将无法获得有效信号。

资源限制与业务规则:偏科模型集中暴露

资源限制场景中,claude-opus-4.7、deepseek-v4-pro、gpt-o3均4/4,而doubao-pro仅2.35/4,claude-sonnet-4.6 2.6/4。业务规则场景则由glm-4.6 4/4领跑,claude-sonnet-4.6垫底2.25/4。偏科模型中,doubao-pro在工程规范4/4与安全合规1.7/4之间差距2.3分,gemini-2.5-pro在数据边界4/4与安全合规2.25/4之间差距1.75分。这些差距源于v3题中KBV复述探针阶段,模型对不同类型约束的记忆保留率差异。

企业生产流程接入的实际含义

把AI接入生产流程的企业,安全合规场景得分低于2.5/4的模型需强制加护栏。qwen3-max与doubao-pro在此场景表现,意味着在涉及数据脱敏、权限审批的流程中,单靠模型守约风险过高。gpt-5.5与gpt-o3在安全合规4/4,可优先用于合规敏感环节。资源限制场景得分低于3/4的模型,建议在预算控制、并发限制类任务中增加外部校验。

战略判断:能力被低估与高估的模型

claude-sonnet-4.6在工程规范4/4却在业务规则仅2.25/4,差距1.75分,其守约能力可能被市场高估,尤其在需要并行硬约束的业务流程中。qwen3-max工程规范4/4与安全合规1.15/4的2.85分差距,显示其在合规场景的脆弱性值得下期重点验证。glm-4.6在业务规则4/4且数据边界4/4,综合守约表现被低估,可作为多场景混合部署的备选。

工程规范场景全员满分说明当前v3.1题池对该约束的施压强度已达上限,下期需增加沉没成本与社会认同复合施压轮次,才能拉开区分度。安全合规场景的低分集中出现,提示企业选型时必须将该场景得分作为一级筛选指标,而非简单参考综合平均分。

安全合规1.15分不是孤立数据,而是生产环境中最可能先破防的缺口。

数据来源:赢政指数 WDCD 守约排行榜 | Run #285 · 场景矩阵 | 评测方法论