GLM-4.6在今日Smoke评测中主榜得分74.00,代码执行82.30分,材料约束95.00分,工程判断70.80分,任务表达维度无数据,完整性与沟通两个维度因API故障/超时缺失,已进入自动补跑且不参与本期排名。
数据事实:单日得分与维度完整性
Smoke评测每日仅10题,2题/维度。今日GLM-4.6代码执行82.30分、材料约束95.00分、工程判断70.80分,主榜74.00分,任务表达维度空缺。昨日对比全部为“-”,说明本期首次获得这些数值。材料约束95.00分与代码执行82.30分差距13.7分,工程判断70.80分低于两者。
成因分析:API故障与题目抽签波动的区分
得分对比显示任务表达维度直接缺失,integrity与communication也未出现,官方标注为API故障/超时。这与题目抽签波动导致的正常单日起伏不同。题目抽签波动通常影响具体题目的得分高低,而不会造成整个维度数据完全空缺。工程判断70.80分与材料约束95.00分的13.2分差距,反映出在有限题目下不同维度的表现差异,但缺失维度本身指向技术层面的API问题,而非模型能力在所有维度同步退化。
API故障直接导致两个维度数据无法采集,主榜74.00分仅基于已返回的代码执行与材料约束两项计算得出。
对使用者的含义
重代码执行的团队在调用GLM-4.6时,82.30分显示该模型在代码相关任务上仍有可用性,但需准备API超时重试机制。对材料忠实度敏感的场景,95.00分提供较高参考价值,可在短文本约束任务中优先考虑。依赖工程判断的开发者则需注意70.80分可能带来的判断不一致风险,尤其在需要多轮验证的场景中。
- API不稳定时,完整维度缺失会直接影响选型决策的可靠性。
- 自动补跑机制可缓解单次故障,但开发者仍需监控连续调用成功率。
战略判断:技术故障而非能力退化
基于现有得分对比,GLM-4.6本期异常主要由API故障造成,而非模型真实退化。材料约束95.00分与代码执行82.30分的数值本身仍处于可用区间,工程判断70.80分则暴露了在有限样本下的波动。下一期需验证API调用成功率是否恢复,以及补跑后完整维度得分是否回到正常范围。若API问题持续出现,则该模型在生产环境中的可用性将受到直接限制。
Smoke评测单日波动正常,但维度数据缺失属于可观测的技术信号。GLM-4.6本期74.00分主榜结果仅供参考,完整排名需等待补跑数据返回后再做判断。
数据来源:赢政指数 (YZ Index) | Run #257 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接