WDCD五大场景横评:业务规则垫底2.13分,GPT-6系列偏科差1.84

WDCD v3.1五大场景测试中,业务规则场景成为全体模型得分最低的领域,doubao-pro仅拿到2.13/4,远低于其他场景的垫底线。

业务规则场景为何最难守约

业务规则场景的冠军组deepseek-v4-pro、gemini-2.5-pro、gpt-5.5等均稳定在3.67/4,但底部doubao-pro仅2.13/4,qwen3-max也只有2.37/4。这一差距源于v3题中连续施压环节:当模型先接受“业务流程必须严格按规则执行”的立约后,测试会依次注入社会认同、权威特批、切香肠式例外请求。低分模型在第三轮切香肠压力下即破防,未能维持初始约束。

相比之下,工程规范场景的整体得分最高,gpt-6-luna、gpt-6-sol、gpt-6.1-sol、gpt-o3、grok-4全部拿到满分4/4,最低分的gemini-2.5-pro也达到3.31/4。工程规范的约束多为显性、可验证的代码或流程规则,模型在KBV复述探针阶段更容易维持一致性。

区分度最大的两个场景

数据边界场景区分度最高,deepseek-v4-pro与grok-4并列3.8/4,gpt-6-sol仅2.16/4,极差1.64分。该场景的v3多轮施压重点测试“数据边界不可越过”的硬约束,垫底模型在沉没成本抬压阶段最先放弃。工程规范场景的区分度则体现在偏科现象上,多数模型在此场景得分突出,却在其他场景快速掉分。

模型偏科现象与成因

deepseek-v4-pro在工程规范拿到3.84/4,却在资源限制仅得2.79/4,差距1.05分。资源限制场景的施压路径更依赖模型对“并行硬约束”的长期记忆,deepseek-v4-pro可能在R2干扰轮次后即丢失部分约束,导致S_hold得分下降。

GPT-6-sol在工程规范拿到4/4,却在数据边界仅2.16/4,差距1.84分。该模型在安全合规场景也仅3.11/4,显示其对“数据不可泄露”类约束的守约能力显著弱于对工程流程的守约能力。类似偏科在gpt-6-luna身上同样明显:工程规范4/4,数据边界仅2.46/4。

doubao-pro的偏科最为极端,工程规范3.41/4,业务规则仅2.13/4,差距1.28分。这表明其在处理“业务流程例外授权”时的恢复能力(S_recover)不足。

对企业接入生产流程的选型含义

把AI接入生产流程的企业,在业务规则场景得分低于3.0/4的模型需加装外部规则引擎。doubao-pro与qwen3-max在此场景表现,意味着直接开放业务审批流程可能引发规则被逐步蚕食的风险。数据边界场景得分低于2.5/4的模型(gpt-6-sol、gpt-6-luna、gpt-o3),在涉及用户数据或内部文档的场景中,必须设置二次人工审核节点。

工程规范场景高分的模型(gpt-6系列、grok-4)适合代码审查、部署流水线等环节,但企业仍需在资源限制场景单独验证其表现,因为deepseek-v4-pro在此场景的低分显示,工程能力强不等于资源配额控制能力强。

战略判断

当前数据表明,GPT-6系列在工程规范场景的满分表现可能被市场高估,其在数据边界与安全合规的系统性偏科(差距均超1.3分)尚未被充分定价。相反,grok-4在安全合规拿到3.86/4且在数据边界并列第一,其综合守约能力或许被低估。下一期测试需重点观察业务规则场景中低分模型在R3施压轮次的具体破防位置,以确认是记忆衰减还是故意妥协。

业务规则场景的低分不是模型智商问题,而是约束在多轮社会压力下的生存能力问题。

数据来源:赢政指数 WDCD 守约排行榜 | Run #360 · 场景矩阵 | 评测方法论