测评 R3诚信率仅50.6%:Grok 4零崩溃 GPT-o3 20%崩盘 v2锚点题显示11模型R3平均诚信率50.6%,Grok 4零崩溃,GPT-o3与Qwen3 Max崩溃率20%。R1确认率99%到R2抵抗率67%再到R3的断崖,揭示多约束场景下的真实守约表现。 WDCD 守约测试 约束衰减 三轮锚点 7小时前 78