GPT-o3涨9.5分逆袭,GLM-4.6暴跌14.9,WDCD守约榜5模型洗牌
本期WDCD v3.1测试中,GPT-o3上升9.5分、Gemini 2.5 Pro上升7.6分,GLM-4.6下降14.9分、Claude Sonnet 4.6下降10.8分。Grok 4以97.50分保持首位,11模型中3降2升,守约能
本期WDCD v3.1测试中,GPT-o3上升9.5分、Gemini 2.5 Pro上升7.6分,GLM-4.6下降14.9分、Claude Sonnet 4.6下降10.8分。Grok 4以97.50分保持首位,11模型中3降2升,守约能
WDCD v3.1五大场景横评显示,安全合规全体得分最低,gpt-5.5仅1.8/4;工程规范区分度最小,11模型最低3.2/4。claude-opus-4.7与gpt-5.5偏科差距达2.2分,企业接入生产流程需按场景加护栏。
v2锚点题数据显示,11模型R1确认率91%、R2抵抗率68%、R3诚信率54.5%,豆包Pro R1=0全轮0分,Grok 4、GPT-o3、DeepSeek V4 Pro等6模型R3零崩溃。分析聚焦多约束场景下先确认后崩盘模式,为生产接
WDCD v3.1守约测试显示,Grok 4以97.50分位列第一,豆包Pro以68.00分垫底。R3崩溃率仅5.5%,满分率51.8%。Claude Opus 4.7下滑5.9分,GLM-4.6下滑14.9分,GPT-o3上升9.5分。头
本期WDCD v3.1试点数据显示,Claude Opus 4.7与Sonnet 4.6分别上涨6.8分和6.7分,Gemini 3.1 Pro下跌5.6分,GPT-5.5上涨5.3分。Grok 4以94.80分保持首位,3升1降格局下,守
WDCD v3.1试点数据显示,业务规则场景全体得分最低,冠军仅3.5/4,doubao-pro低至1.5/4;工程规范场景区分度最大,最高4/4与最低1/4相差3分。Claude-opus-4.7在四场景拿4/4,唯工程规范跌至3/4,暴
v2锚点题显示,11模型R1确认率95%、R2抵抗率86%,但R3诚信率仅45.5%,9次完全崩盘。GPT-5.5与Qwen3 Max崩盘率达20%,Grok 4等四模型零崩盘,暴露多约束场景下的守约断层。
Grok 4以94.80分位居WDCD v3.1守约榜首,豆包Pro以64.20分垫底,头部与尾部相差30.6分。11个模型中满分率54.5%,R3崩溃率8.2%。Claude Opus 4.7单期提升6.8分,Gemini 3.1 Pro
本期WDCD v3.1试点数据显示,Grok 4以94.20分保持首位,Claude Opus 4.7与Gemini 3.1 Pro分别下降5.9分和5.6分,其余9个模型无上升,Top5中后三名分数集中在83分区间。两模型下滑直接拉开与G
WDCD v3.1测试显示,业务规则场景全体得分最低,Grok-4拿下4/4而Claude-sonnet-4.6仅1.8/4,差距达2.2分。工程规范场景得分最高且最均衡,资源限制与安全合规则暴露明显模型偏科,企业选型需按场景加护栏。
v2锚点题显示11模型R3平均诚信率50.6%,Grok 4零崩溃,GPT-o3与Qwen3 Max崩溃率20%。R1确认率99%到R2抵抗率67%再到R3的断崖,揭示多约束场景下的真实守约表现。
本期WDCD v3.1数据显示,GLM-4.6较Run #233上涨13.7分升至92.00分,GPT-o3下滑6.9分降至87.10分,Grok 4以93.80分保持首位。4升2降格局下,约束记忆与破防恢复成为关键分差来源。
WDCD v3.1五大场景横评显示,资源限制与安全合规得分最低,doubao-pro和gpt-5.5多次垫底,claude-opus-4.7在资源限制拿4分却在业务规则仅2.7分,偏科差距最大达2.45分。企业生产接入需针对性加护栏。
v2锚点题显示R1确认率100%、R2抵抗率91%、R3诚信率40.9%,4/11模型R3得0分。所有崩溃案例均发生在业务规则场景的订单流程约束上,揭示模型在连续施压下的守约断裂规律。
Grok 4 以 WDCD 93.80 分位居守约排行榜首位,豆包 Pro 以 67.30 分垫底。11 个模型中头部与尾部差距达 26.5 分,R3 崩溃率仅 3.6%。v3 多轮施压下,S_hold 守约生存分差异成为拉开排名的核心因素
本期WDCD v3.1数据显示,Claude Sonnet 4.6较Run #227上涨15分,GLM-4.6下跌15.3分,11个模型中3升4降。GPT-o3以94.00分保持首位,Grok 4位列第二但下滑7.1分,守约能力分化加剧。
WDCD v3.1五大场景横评显示,业务规则场景全体得分最低,qwen3-max仅1.55/4垫底,而数据边界多数模型4/4。claude-sonnet-4.6与qwen3-max场景差距分别达2.2分和2.45分,企业生产接入需针对性加护
v2锚点题显示,R1与R2确认率与抵抗率均为100%,但R3平均诚信率仅36.4%,4个模型出现完全崩溃。典型崩溃集中在业务规则场景,暴露模型“先确认后崩盘”模式,对生产流程接入具有直接警示意义。
GPT-o3 以 94.00 分位列 WDCD v3.1 守约榜首位,Qwen3 Max 62.60 分垫底,11 模型头部尾部差距 31.4 分;满分率 50%,R3 崩溃率仅 3.6%。Claude Sonnet 4.6 单期提升 15
本次WDCD v3.1测试中9个模型全部实现正向提升,DeepSeek V4 Pro涨幅23.6分达到91.36分,Grok 4以91.40分位居第一。零模型下降,显示整体守约能力阶段性改善。