Gemini 2.5 Pro WDCD暴涨22.2分,Claude Sonnet 4.6独跌13分
Gemini 3.1 Pro以97.70分登顶WDCD,Gemini 2.5 Pro单期上升22.2分,Claude Sonnet 4.6成为唯一下降模型(-13分)。5升1降格局下,守约生存与约束记忆分化明显,企业生产接入需优先高分模型。
Gemini 3.1 Pro以97.70分登顶WDCD,Gemini 2.5 Pro单期上升22.2分,Claude Sonnet 4.6成为唯一下降模型(-13分)。5升1降格局下,守约生存与约束记忆分化明显,企业生产接入需优先高分模型。
本期 WDCD v3.1 试点中,11 个模型里 4 升 1 降。Gemini 2.5 Pro 上升 8.7 分、GPT-5.5 上升 7.9 分、Claude Opus 4.7 上升 6.1 分,豆包 Pro 下降 7.3 分。Grok
WDCD v3.1试点数据显示,豆包 Pro 较 Run #271 上升 13.8 分,GLM-4.6 上升 9.9 分,Gemini 3.1 Pro 上升 6.8 分;DeepSeek V4 Pro 下降 8 分,GPT-o3 下降 11
本次WDCD v3.1测试中9个模型全部实现正向提升,DeepSeek V4 Pro涨幅23.6分达到91.36分,Grok 4以91.40分位居第一。零模型下降,显示整体守约能力阶段性改善。