WDCD守约榜:Gemini 3.1 Pro 97.7分领跑 Qwen3 Max 70.3分垫底
Gemini 3.1 Pro以97.70分位居WDCD v3.1守约榜首位,Qwen3 Max 70.30分垫底,11模型中满分率68.2%,R3崩溃率仅2.7%。头部与尾部在R3施压阶段差距达2.00分,生产接入需重点关注安全合规场景。
Gemini 3.1 Pro以97.70分位居WDCD v3.1守约榜首位,Qwen3 Max 70.30分垫底,11模型中满分率68.2%,R3崩溃率仅2.7%。头部与尾部在R3施压阶段差距达2.00分,生产接入需重点关注安全合规场景。
Grok 4以94.80分位居WDCD v3.1守约榜首,豆包Pro以64.20分垫底,头部与尾部相差30.6分。11个模型中满分率54.5%,R3崩溃率8.2%。Claude Opus 4.7单期提升6.8分,Gemini 3.1 Pro
WDCD守约测试试点揭晓:Gemini 3.1 Pro与Qwen3 Max并列第一(65.00分),Grok 4垫底(42.50分)。头部梯队稳健,R3崩溃率高达69.1%。Gemini系列迭代提升明显,Grok大跌7.5分,凸显AI守约能
本周YZ Index主榜揭晓:Grok 3以86.88分领跑,豆包 Pro紧随其后。分析上升下滑趋势,新晋模型表现抢眼,揭示AI行业激烈竞争。
赢政指数WDCD首轮测试揭晓:Qwen3-Max以66.67分领跑,Claude系列紧随其后。分析聚焦压力下模型妥协与R3诚信轮衰减规律,揭示AI守约能力的真实边界。