Grok 4在今日Smoke评测中代码执行得分从95.30分降至64.00分,降幅31.3分,同时材料约束从48.40分升至83.10分,涨幅34.7分,主榜得分从74.20分微降至72.60分。
得分对比与核心事实
工程判断从50.00分升至80.60分,任务表达从75.00分升至81.10分,诚信评级维持pass。主榜由代码执行与材料约束加权构成,今日两维度反向变动幅度接近,导致主榜仅小幅回落。
波动成因分析
Smoke评测每日仅2题/维度,单题得分权重高。代码执行从95.30分跌至64.00分,最可能源于今日抽签题目对代码生成或执行路径要求更高,而昨日题目相对宽松。材料约束同时大幅上升,说明同一批题目在引用忠实度或约束遵守上更容易得分,两者并非模型能力整体退化,而是题目抽签带来的随机波动。
若为真实退化,材料约束与工程判断通常不会同步大幅上升。今日数据中材料约束与工程判断均出现30分以上增幅,指向题目特性变化而非模型参数或训练数据出现系统性问题。
对使用者的具体含义
重度依赖代码执行的团队在今日及短期内需对Grok 4输出进行额外人工校验,尤其涉及多步计算或复杂脚本的场景。材料约束得分升至83.10分,表明该模型在需要严格遵循输入材料或格式约束的任务中表现更稳定,适合文档生成、合规检查等场景。
开发者若同时使用代码执行与材料约束两个维度,今日主榜72.60分仍处于可用区间,但需注意单维度波动可能放大特定任务失败率。
战略判断
基于今日得分反向变动,主榜小幅回落主要由代码执行单维度拉动,而非模型整体能力下降。工程判断与任务表达同步上升,进一步支持波动源于题目抽签而非模型退化。下一期评测需重点验证代码执行是否回升至90分以上区间,若连续两日维持低位则需重新评估。
当前数据不支持对Grok 4代码能力进行长期下调判断,单日31.3分跌幅属于Smoke评测正常波动范围。建议选型团队继续跟踪后续3-5日同一维度得分标准差,而非依据单日数据调整部署策略。
数据来源:赢政指数 (YZ Index) | Run #361 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接