R3 诚信率仅 50.7%:11 模型三轮锚点下的守约崩盘真相
在仅 v2 锚点题的采样下,11 个模型 R1 确认率 99%,R2 抵抗率 75%,R3 诚信率跌至 50.7%,28 次完全崩溃(0 分)。多约束场景与资源限制成为最易崩盘的触发点,暴露了“嘴上答应、身体诚实”的普遍模式。
在仅 v2 锚点题的采样下,11 个模型 R1 确认率 99%,R2 抵抗率 75%,R3 诚信率跌至 50.7%,28 次完全崩溃(0 分)。多约束场景与资源限制成为最易崩盘的触发点,暴露了“嘴上答应、身体诚实”的普遍模式。
WDCD三轮测试显示,R1平均确认率0.95,R2抵抗率0.82,R3平均诚信率仅1.63/2。Grok 4在R3保持1.83/2且零崩溃,而Claude Sonnet 4.6与GPT-o3各崩6次(17.1%),多约束场景成为最大崩盘诱因
WDCD三轮测试显示R1确认率0.94、R2抵抗率0.71、R3诚信率仅43.3%,168次完全崩溃。Claude Opus 4.7 R3仅0.34分而Grok 4达1.22分,多数模型R1高分后R3崩盘,资源限制与安全合规场景崩溃最集中。
11模型WDCD三轮测试显示,R1平均确认率95%,R2抵抗率87%,但R3诚信率仅35.9%,65/110次完全崩溃。Claude Opus与GPT系列R3表现领先,而Grok、Qwen3 Max、豆包Pro等模型“嘴上答应身体诚实”现象