Grok 4 材料约束暴跌17.6分 主榜仅降1.8分
今日Smoke评测中Grok 4材料约束从82.60分跌至65.00分,降幅17.6分,主榜从82.99分微降至81.23分。代码执行反升11.2分至94.50分,工程判断升至100分,诚信评级从pass转为warn。单日10题快测下,这一
今日Smoke评测中Grok 4材料约束从82.60分跌至65.00分,降幅17.6分,主榜从82.99分微降至81.23分。代码执行反升11.2分至94.50分,工程判断升至100分,诚信评级从pass转为warn。单日10题快测下,这一
WDCD v3.1守约测试显示,Grok 4以97.50分位列第一,豆包Pro以68.00分垫底。R3崩溃率仅5.5%,满分率51.8%。Claude Opus 4.7下滑5.9分,GLM-4.6下滑14.9分,GPT-o3上升9.5分。头
Grok 4今日Smoke评测代码执行从92.00分跌至72.50分,降19.5分;材料约束从60.90分升至84.10分,增23.2分;主榜从78.01分微降至77.72分。工程判断同步跌19.5分,任务表达升10分。单日10题快测下,需
Grok 4今日Smoke评测主榜从89.30分跌至78.01分,降幅11.3分。其中材料约束从78.90分骤降至60.90分,代码执行从97.80分降至92.00分,工程判断则从81.90分升至94.50分。单日波动主要集中在材料约束维度
本期WDCD v3.1试点数据显示,Claude Opus 4.7与Sonnet 4.6分别上涨6.8分和6.7分,Gemini 3.1 Pro下跌5.6分,GPT-5.5上涨5.3分。Grok 4以94.80分保持首位,3升1降格局下,守
Grok 4今日Smoke评测主榜从94.15分跌至76.65分,降幅17.5分。其中材料约束从87.00分跌至65.10分,代码执行从100.00分跌至86.10分。单日10题抽签导致的波动与模型真实能力退化需进一步验证。
Grok 4 今日 Smoke 评测主榜从 87.66 分跌至 79.30 分,降幅 8.4 分,主要源于材料约束从 79.30 分跌至 61.70 分。代码执行仅降 0.8 分,工程判断反升 15.3 分,诚信评级从 pass 转为 wa
Grok 4 以 WDCD 95.00 分位居第一,Claude Sonnet 4.6 以 64.10 分垫底,头部尾部差距 30.9 分。R3 崩溃率仅 4.5%,DeepSeek V4 Pro R3 满分 2.00/2 成关键拉分点。
Grok 4 以 91.20 分位列 WDCD 守约排行榜第一,Qwen3 Max 57.48 分垫底,头部尾部相差 33.72 分。11 个模型中满分率仅 29.1%,R3 崩溃率达 16%,v2 锚点题 R3 得分成为区分关键。
赢政指数今日Smoke评测显示,Grok 4主榜从97.98分跌至82.73分,降幅15.3分,其中代码执行从100.00分骤降至68.60分。材料约束和任务表达反而上升,诚信评级维持pass。单日10题快测下,此类波动是否反映真实能力变化
赢政指数 2026-W25 Smoke 7 天数据显示,Grok 4 趋势上涨 19.8 分至 100,DeepSeek V4 Pro 均值 98.7 分保持领先;Gemini 2.5 Pro 与 Gemini 3.1 Pro 波动分别达
在赢政指数今日Smoke评测中,Grok 4材料约束从96.70分跌至71.10分,降幅25.6分,但代码执行升至100分、主榜升至87分。单日10题快测下,多维度剧烈波动更可能源于题目抽签而非模型退化。
2026-06-18 Smoke评测中,Claude Opus 4.7等四模型主榜、执行、约束三项均达100分。Grok 4材料约束单日暴跌25.6分至71.1分,导致主榜仅87分,与满分模型差距13分。执行维度11模型中有10个满分,约束
赢政指数今日Smoke评测显示,Grok 4材料约束从83.00降至61.30,跌21.7分,而代码执行从80.90升至100.00,主榜微升0.7分至82.59。单日10题快测下,此幅度波动是否为抽签随机还是真实能力变化值得追踪。
2026年6月15日Smoke评测显示,11个模型材料约束平均下滑30分以上,Grok 4以主榜82.59分(执行100、约束61.3)暂居第一,豆包Pro与GPT-5.5并列第二。Gemini 3.1 Pro主榜暴跌39.4分,执行从97
今日Smoke评测中Grok 4代码执行从100.00跌至80.90,主榜从89.56降至81.85。工程判断更从88.00腰斩至55.00,材料约束反而升6.2分。需判断是题目抽签波动还是真实能力退化。
WDCD三轮测试显示R1确认率0.94、R2抵抗率0.71、R3诚信率仅43.3%,168次完全崩溃。Claude Opus 4.7 R3仅0.34分而Grok 4达1.22分,多数模型R1高分后R3崩盘,资源限制与安全合规场景崩溃最集中。
Grok 4 以 74.22 分位居 WDCD 守约测试首位,GPT-o3 以 51.56 分垫底。R3 崩溃率达 47.7%,满分率仅 19.3%。所有 11 个模型较上期均出现分数下滑,头部与尾部在压力轮得分差距明显。
本周 7 款新模型首次上榜即拿下 72.4-80.9 分,Grok 4 以 89.90 分登顶,DeepSeek V3、R1、文心 4.0 等 6 款旧模型同时退出,旧榜单结构被彻底打破。
Run #141中Grok 4+10.8、GPT-5.5+9.2大幅上升,Qwen3 Max-10.8、DeepSeek V4 Pro-6.7显著下滑,Claude Opus 4.7重返并列第一,揭示prompt敏感度与模型更新对守约能力的