GLM-4.6材料约束暴跌21分,代码执行反升25分,主榜微涨4.3

GLM-4.6在今日Smoke评测中材料约束得分从74.30分降至53.30分,降幅21分,代码执行得分从50.00分升至75.00分,主榜得分从60.94分升至65.24分。

得分对比与直接事实

昨日到今日的具体变化为:代码执行50.00→75.00,材料约束74.30→53.30,工程判断25.00→95.80,任务表达25.00→50.00,主榜60.94→65.24,诚信评级pass→warn。Smoke评测每日仅10题,每维度2题,单日分数波动属于正常范围。

可能成因分析

材料约束维度暴跌21分,最可能源于当日抽签的2道材料约束题目难度或类型与模型当前输出风格不匹配。代码执行同时上升25分,显示模型在另一维度上对题目要求响应更准确。工程判断从25.00升至95.80的巨大变化,进一步支持题目抽签随机性是主要驱动因素,而非模型整体能力退化。

诚信评级从pass变为warn,表明本次回答中可能出现与材料不一致或虚构细节的情况,这与材料约束得分下降直接相关。任务表达得分上升25分,说明模型在任务描述清晰度上有所改善,但未能抵消材料约束的损失。

对使用者的含义

对重度依赖材料忠实度的企业场景,例如合同审查、政策解读或技术文档生成,GLM-4.6今日表现提示需增加人工校验环节。代码执行得分提升,对需要快速生成可运行代码的开发者而言,本次结果反而提供正面信号。

工程判断得分大幅上升,对需要模型进行方案可行性判断的团队,本次数据可能低估其实际能力。主榜仅上涨4.3分,说明材料约束的损失被代码执行的增益部分抵消,但诚信评级warn已构成选型时的明确提醒。

战略判断

基于当前得分对比,材料约束21分跌幅与工程判断70.8分涨幅同时出现,最合理的解释是题目抽签波动而非模型真实退化。Smoke评测每日样本量小,单日异常不足以判定模型能力方向性变化。

建议下期评测重点观察材料约束是否回升至70分以上,以及诚信评级是否恢复pass。若连续两日材料约束保持在55分以下且诚信评级维持warn,则需将GLM-4.6在材料敏感场景的使用优先级下调。

目前数据不支持对模型进行长期负面定性判断,但warn的诚信评级已构成短期使用风险信号,依赖该模型的开发者应在材料约束相关任务中增加二次验证步骤。


数据来源:赢政指数 (YZ Index) | Run #309 | 查看原始数据