测评 Grok 4 93.80 分登顶 WDCD 守约榜,GLM-4.6 68 分垫底差距 25.8 分 Grok 4 以 93.80 分位居 WDCD v3.1 守约榜首,GLM-4.6 以 68.00 分垫底。11 个模型中 R3 崩溃率 9.1%,满分率 48.2%。头部与尾部差距主要体现在 R3 施压阶段的约束维持能力上。 WDCD 守约测试 AI模型约束 排行榜分析 1天前 26