测评 WDCD守约榜Grok 4 91.04分夺冠 豆包Pro 58分垫底差距33分 Grok 4以91.04分位居WDCD守约榜首,豆包Pro仅58分垫底,R3施压轮崩溃率达12.4%。11个模型中头部与尾部差距超过33分,Claude Sonnet 4.6单期提升8.8分,GPT-5.5提升5分。数据揭示多轮渐进施压下模 WDCD 守约测试 AI模型排行 约束遵守能力 7小时前 56