测评 Grok 4 93.80 分守约第一 豆包 Pro 67.30 分垫底差距 26.5 分 Grok 4 以 WDCD 93.80 分位居守约排行榜首位,豆包 Pro 以 67.30 分垫底。11 个模型中头部与尾部差距达 26.5 分,R3 崩溃率仅 3.6%。v3 多轮施压下,S_hold 守约生存分差异成为拉开排名的核心因素 WDCD 守约测试 AI模型评估 约束遵守能力 10小时前 59