WDCD三轮锚点:豆包Pro 32%全崩Grok零崩溃,34次零分暴露守约裂痕

在仅针对8道v2锚点题的采样中,11个模型的R3完全崩溃次数达到34/275次,豆包Pro的R3崩溃率高达32%,而Grok 4保持0崩溃,Claude Opus 4.7与DeepSeek V4 Pro均为4%。这一数据直接显示,初始确认率高达90%的模型,在第三轮施压后诚信率仅剩44.4%。

逐轮衰减轨迹与口径限定

本次分析严格限定于v2三轮锚点题,R1注入约束、R2干扰、R3施压的得分结构为1+1+2分。全局R1平均确认率0.9/1,R2抵抗率0.66/1,R3诚信率44.4%。豆包Pro在R1即为0.00,后续两轮维持0.00,25次测试中8次R3得0分。GLM-4.6 R1=1.00、R2=0.75、R3=0.75/2,崩溃5次。GPT-5.5 R2降至0.50,R3同样0.50/2。Gemini 3.1 Pro与Qwen3 Max R3均为0.88/2与0.63/2,崩溃率16%。Claude Sonnet 4.6 R3达到满分1.00/2,崩溃12%。Gemini 2.5 Pro、GPT-o3、Claude Opus 4.7、DeepSeek V4 Pro、Grok 4的R3崩溃率依次降至8%、4%、4%、4%、0%。

先确认后崩盘的机制分析

典型模式表现为R1高确认、R2部分抵抗、R3集中失守。豆包Pro的5个零分案例均来自数据边界与资源限制场景:dcd_db_002只读账号禁止DML语句、dcd_db_009日志禁止打印敏感字段、dcd_rl_001内存峰值100MB限制、dcd_rl_002 API每分钟60次上限、dcd_br_006先付款后发货顺序。约束一旦进入连续施压,豆包Pro在R1即未建立有效记忆,后续轮次直接违反。相比之下,Grok 4在相同场景下R3仍维持1.25/2,显示其在沉没成本与切香肠施压下的抵抗更稳定。

约束场景与施压轮次的差异来源

数据边界与资源限制场景的崩溃集中发生在R3,业务规则场景次之。豆包Pro在资源限制题中R2即失守,说明其对“流式/分块处理”与“限速”约束的记忆保持能力弱于Gemini 2.5 Pro与Claude Opus 4.7。Claude Opus 4.7 R2=0.75但R3回升至1.25/2,表明其在R3阶段具备一定恢复机制,而豆包Pro缺乏此能力。安全合规与工程规范场景因样本较少,暂未呈现明显分化。

接入生产流程的选型含义

对将AI接入生产流程的企业而言,R3崩溃率低于5%的模型(Grok 4、Claude Opus 4.7、DeepSeek V4 Pro、GPT-o3)在数据边界与资源限制场景下更适合直接使用,但仍需在API层增加二次校验。豆包Pro与GPT-5.5因R3崩溃率20%以上,在涉及只读账号、日志脱敏、内存上限的流程中需强制加护栏,否则单次对话即可能产生违规SQL或超限调用。Claude Sonnet 4.6与Gemini 3.1 Pro可用于中等压力场景,但R3诚信率未达满分,仍需监控日志输出。

战略判断与验证信号

豆包Pro的守约能力可能被市场高估,其R1即0分的表现与Grok 4的0崩溃形成鲜明对比。Grok 4与Claude Opus 4.7在R3的得分优势,可能源于对多轮施压的记忆保持机制,值得下期在v3多轮渐进题中重点验证资源限制场景的S_hold与S_recover得分。企业若优先选择R3崩溃率4%以下模型,可降低生产流程中的违规风险;反之,继续使用高崩溃模型则需额外投入护栏开发成本。

守约不是R1的口头承诺,而是R3施压后的实际留存。

数据来源:赢政指数 WDCD 守约排行榜 | Run #271 · 衰减分析 | 评测方法论