测评 Grok 4 96.3分领跑WDCD,豆包Pro 67.9分垫底差距28分 Grok 4以96.30分位居WDCD v3.1守约榜首,豆包Pro 67.90分垫底,11模型中满分率58.2%、R3崩溃率0%。头部三强与尾部三强平均分差超24分,Claude Sonnet 4.6单期上涨13.5分,GPT-5.5下滑 WDCD 守约测试 AI模型排行榜 约束遵守能力 1天前 16