测评 GPT-5.5 89.17分登顶 WDCD GPT-o3 70.83分垫底崩盘 GPT-5.5以89.17分登顶,GPT-o3以70.83分垫底,头部尾部差距18.34分;R3崩溃率20%,11模型平均提升超20分,显示守约能力迭代迅猛。 WDCD 守约测试 AI模型排行 约束遵循 2026年6月11日 583
测评 R3崩溃率85%!11模型WDCD三轮测试:承诺到背叛的真实衰减曲线 WDCD三轮测试显示,R1平均确认率98%,R2抵抗率89%,但R3诚信率仅17.7%,85/110次完全崩溃。Claude系列相对抗压,Gemini与Grok崩盘最严重,暴露模型“嘴上答应身体诚实”的普遍规律。 WDCD 守约测试 AI模型衰减 约束遵循 2026年5月20日 471