Grok 4在今日Smoke评测中材料约束得分从82.60分跌至65.00分,主榜整体仅从82.99分降至81.23分。
得分对比数据
代码执行从83.30分升至94.50分,工程判断从30.60分升至100.00分,任务表达从75.00分降至70.00分,诚信评级从pass变为warn。材料约束这一单一维度17.6分的跌幅远超主榜1.8分的整体变化。
波动成因分析
Smoke评测每日仅10题,2题对应材料约束维度。65.00分意味着该维度2题平均得分显著低于昨日。代码执行同期提升11.2分,说明模型在代码相关任务上表现更稳定。材料约束得分下降最可能源于当日抽取的2道材料忠实度题目难度或约束条件更严格,而非模型整体能力退化。工程判断大幅上升也印证模型在侧榜任务上未出现系统性问题。
诚信评级从pass转为warn,提示本次回答可能出现轻微事实偏差或约束违反,这与材料约束得分直接相关。材料约束维度主要考核模型对给定材料的忠实程度,65.00分表明模型在至少一题中出现了明显偏离或过度发挥。
对使用者的具体影响
依赖材料约束的开发者在生成报告、合同摘要或技术文档时,需增加人工校验环节。重代码执行的团队可继续使用Grok 4,其94.50分表现优于昨日。需要高材料忠实度的场景如法律文本处理、学术引用生成,当前65.00分水平可能导致输出偏离原始材料,增加返工风险。
战略判断
主榜仅降1.8分说明整体能力未崩,但材料约束单维度17.6分跌幅与诚信评级warn信号叠加,构成需要下期验证的明确信号。若下一日材料约束回升至80分以上,则本次更可能是题目抽签波动;若持续低于70分,则需考虑模型在材料约束上的真实稳定性下降。当前数据不支持将Grok 4材料约束能力判定为系统性退化,但已构成值得重点跟踪的异常点。
工程判断升至100.00分显示模型在侧榜任务上仍有余力,任务表达小幅下降5分影响有限。综合主榜81.23分与材料约束65.00分,选型企业应在材料敏感场景下暂时降低Grok 4优先级,等待后续Smoke评测数据确认趋势。
数据来源:赢政指数 (YZ Index) | Run #266 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接