测评 GLM-4.6暴跌29.8分 GPT-5.5下滑6分 WDCD守约测试两模型全线退步 本期WDCD v3.1试点仅GLM-4.6与GPT-5.5出现下降,分别下跌29.8分和6分,其余9个模型无上升。Grok 4以91.76分保持首位,Gemini 3.1 Pro 89.59分紧随。数据揭示守约能力在多轮施压下的脆弱性差异, WDCD 守约测试 模型评估 动态追踪 7小时前 62