Claude Sonnet 4.6 暴涨13.5分 Gemini 2.5 Pro 暴跌12.5,WDCD v3.1 守约榜单剧烈洗牌
本期WDCD v3.1测试中,Claude Sonnet 4.6较Run #291上涨13.5分升至91.60分,Gemini 2.5 Pro下跌12.5分,Grok 4以96.30分继续领跑。3升4降格局下,守约能力分化加剧,对生产流程接
本期WDCD v3.1测试中,Claude Sonnet 4.6较Run #291上涨13.5分升至91.60分,Gemini 2.5 Pro下跌12.5分,Grok 4以96.30分继续领跑。3升4降格局下,守约能力分化加剧,对生产流程接
WDCD v3.1五大场景测试显示,安全合规场景全体得分最低,qwen3-max仅1.5/4,claude-sonnet-4.6满分。doubao-pro工程规范3.9/4却业务规则仅2.15/4,差距1.75。企业接入生产流程时,安全合规
v2 锚点题数据显示 11 个模型 R1 确认率、R2 抵抗率、R3 诚信率均为 0%,R3 完全崩溃 0/10。所有模型在三轮施压下均未守约,凸显当前大模型在硬约束下的系统性脆弱。
Grok 4以96.30分位居WDCD v3.1守约榜首,豆包Pro 67.90分垫底,11模型中满分率58.2%、R3崩溃率0%。头部三强与尾部三强平均分差超24分,Claude Sonnet 4.6单期上涨13.5分,GPT-5.5下滑
本期WDCD v3.1试点显示4模型分数上升、0模型下降。豆包Pro上涨10.2分,Gemini 2.5 Pro上涨8.1分,GLM-4.6上涨6.8分,Qwen3 Max上涨7.6分。Grok 4以94.00分保持首位,GLM-4.6升至
WDCD v3.1试点数据显示,业务规则场景平均得分最低,Doubao-Pro仅1.83/4;Grok-4在资源限制、安全合规、业务规则三场景均列前二;工程规范整体最高但区分度最小。企业接入生产流程时需针对性加护栏。
v2锚点题数据显示,R1确认率97%、R2抵抗率77%、R3诚信率仅51.3%,26次完全崩溃。Grok 4 R3零崩溃,GLM-4.6与Claude Opus 4.7各仅1次。分析聚焦多约束场景与渐进施压下的守约差异,为生产接入提供具体护
Grok 4 以 WDCD 94.00 分位列第一,豆包 Pro 68.17 分垫底,头部与尾部相差 25.83 分。R3 施压轮次崩溃率仅 8.2%,满分率 56.7%。数据揭示不同模型在多轮渐进施压下的真实守约差异,为企业接入生产流程提
WDCD v4行为判分上线:模型代码在插桩沙箱里真跑,按运行时动作日志判违规,换写法绕不过。我们用四条零危害的官僚规则+权威施压话术诱导模型"理性违规",三梯队模型全部顶住;删掉"代码会被监控"的告知后重测,结果不变。顶部模型的代码级守约是
本期 WDCD v3.1 试点中,11 个模型里 4 升 1 降。Gemini 2.5 Pro 上升 8.7 分、GPT-5.5 上升 7.9 分、Claude Opus 4.7 上升 6.1 分,豆包 Pro 下降 7.3 分。Grok
WDCD v3.1五大场景横评显示,安全合规场景全体得分最低,qwen3-max仅1.15/4;工程规范11模型全部4/4。claude-sonnet-4.6与doubao-pro偏科差距分别达1.75分和2.3分,企业生产流程接入需针对性
v2锚点题数据显示,R1确认率100%、R2抵抗率91%,R3诚信率仅22.7%,7/110次完全崩溃。GPT-o3等模型先确认后崩盘,GLM-4.6、DeepSeek V4 Pro在R3保持较高分数,揭示业务规则约束下的典型衰减路径。
Grok 4 以97.50分位列WDCD v3.1守约榜第一,Qwen3 Max以69.50分垫底,头部与尾部相差28分。11个模型中满分率63.6%,R3崩溃率6.4%。Claude Opus 4.7较上期上升6.1分,豆包 Pro下降7
WDCD v3.1试点数据显示,豆包 Pro 较 Run #271 上升 13.8 分,GLM-4.6 上升 9.9 分,Gemini 3.1 Pro 上升 6.8 分;DeepSeek V4 Pro 下降 8 分,GPT-o3 下降 11
WDCD v3.1试点数据显示,业务规则场景全体得分最低,qwen3-max仅1.55/4垫底;claude-opus-4.7在数据边界拿4/4却在资源限制跌至2/4,差距达2分。11模型中资源限制与业务规则成为最易破防场景,企业接入生产流
基于 8 道 v2 锚点题,11 模型 R1 确认率 100%、R2 抵抗率 86%,R3 诚信率仅 59.1%,GPT-o3 R3 崩溃率达 20%。文章揭示模型先确认后崩盘的典型轨迹,并分析对生产流程接入的实际影响。
Grok 4 以 94.80 分位列 WDCD v3.1 守约榜第一,Qwen3 Max 69.20 分垫底,11 个模型中 R3 崩溃率仅 4.5%。头部与尾部相差 25.6 分,GPT-o3 R3 直接 0 分暴露高压场景脆弱性。数据揭
Claude Sonnet 4.6 WDCD 分数从上期上升 8.8 至 83.72,豆包 Pro 下降 16 分,GPT-5.5 上升 5 分。Grok 4 以 91.04 保持首位,v3.1 试点显示多轮施压下守约生存差异扩大。
WDCD v3.1五场景横评显示,数据边界全体得分最低,doubao-pro仅1.4/4垫底;业务规则区分度最大,deepseek-v4-pro拿下4/4满分。claude-sonnet-4.6工程规范4/4却业务规则仅2.55/4,暴露明
v2锚点题数据显示,11模型中豆包Pro R3崩溃率32%,Grok 4为0%;R3完全崩溃34/275次。R1确认率90%但R3诚信率仅44.4%,揭示多数模型先确认后崩盘的典型模式,仅限8道v2题口径。