Grok 4主榜暴跌8.8分:代码执行从100掉到90.7

Grok 4在今日Smoke评测中,主榜得分从昨日96.99分降至88.14分,单日跌幅8.8分。代码执行维度从100.00分跌至90.70分,材料约束从93.30分跌至85.00分,两者合计拉低主榜。

得分变化拆解

代码执行维度跌幅最大,达到9.3分。材料约束维度同步下降8.3分。工程判断从69.50分升至75.00分,任务表达从95.00分降至91.70分。诚信评级保持pass,未触发门槛。

可能成因分析

Smoke评测每日仅10题,2题对应一个主榜维度。代码执行与材料约束各抽中2题,单题失误即可造成8-10分级波动。昨日代码执行满分,今日90.70分,最可能源于抽中难度更高的编程或调试题目,而非模型本身突然退化。材料约束同步下降,提示今日题目可能包含更多需要严格忠实原文的任务。

工程判断反向上升5.5分,表明侧榜题目抽签与主榜存在独立性。任务表达小幅回落3.3分,幅度小于主榜核心维度。综合看,今日变化更符合题目抽签波动,而非模型真实能力退化。

对使用者的含义

重度依赖代码执行的开发者团队,需注意Grok 4在高难度编程任务上的单次表现可能出现较大起伏。材料约束敏感的场景,如法律合同审查或技术文档提取,今日85.00分提示需增加人工复核环节。

工程判断小幅提升,对侧重系统设计判断的场景影响有限。整体主榜88.14分仍处于可用区间,但连续多日低于90分将改变选型优先级。

战略判断

基于单日数据,Grok 4主榜跌幅主要由题目抽签驱动,尚未构成真实退化信号。下一期Smoke评测若代码执行与材料约束同时回升至95分以上,则可确认本次为正常波动;若持续低于90分,则需重点验证模型在复杂约束任务上的稳定性。

目前无证据支持Grok 4被高估或低估,建议保持观察窗口至至少3个连续评测日。


数据来源:赢政指数 (YZ Index) | Run #300 | 查看原始数据