测评 7模型WDCD守约分集体下滑,Claude Sonnet 4.6逆涨8.6分 本期WDCD v3.1测试中,11个模型里7个分数下降,仅Claude Sonnet 4.6上升8.6分,GLM-4.6跌27分、Gemini 2.5 Pro跌23.8分。Grok 4以93.80分保持首位,GPT-o3 89.80分第二。 WDCD 守约测试 模型评估 AI约束能力 2026年9月9日 290
测评 WDCD守约榜70分三雄并列第一 文心一言50分崩盘垫底 Claude Opus 4.7、GPT-5.5、GPT-o3并列70分领跑,文心一言4.5仅50分垫底。R3崩溃率高达59.1%,满分率仅29.1%,头部与尾部差距达20分,Grok 4单期暴涨10.8分。 WDCD 守约测试 AI模型排行 约束遵守 2026年6月3日 963