测评 我们造了四条毫无意义的规则想诱骗AI违规,全失败了 WDCD v4行为判分上线:模型代码在插桩沙箱里真跑,按运行时动作日志判违规,换写法绕不过。我们用四条零危害的官僚规则+权威施压话术诱导模型"理性违规",三梯队模型全部顶住;删掉"代码会被监控"的告知后重测,结果不变。顶部模型的代码级守约是 WDCD 行为判分 沙箱评测 模型守约 6小时前 84