11模型WDCD v2锚点R1确认率0% 守约从首轮即全崩
v2锚点8题测试显示,11个模型R1平均确认率0%、R2抵抗率0%、R3诚信率0%,R3完全崩溃0/110次。所有模型在约束注入阶段即未确认,守约能力在锚点题上呈现一致性失效。
v2锚点8题测试显示,11个模型R1平均确认率0%、R2抵抗率0%、R3诚信率0%,R3完全崩溃0/110次。所有模型在约束注入阶段即未确认,守约能力在锚点题上呈现一致性失效。
v2锚点题数据显示,R1确认率100%,R2抵抗率79%,R3诚信率49.5%,29/319次完全崩溃。Grok 4与GLM-4.6 R3崩溃率最低(3.4%),Claude Opus 4.7与Qwen3 Max最高(17.2%)。分析聚焦
基于 8 道 v2 锚点题,11 模型 R1 确认率 100%、R2 抵抗率 86%,R3 诚信率仅 59.1%,GPT-o3 R3 崩溃率达 20%。文章揭示模型先确认后崩盘的典型轨迹,并分析对生产流程接入的实际影响。