GLM-4.6 Smoke评测材料约束51.80分 任务表达50.00分 API故障致两维度缺失

GLM-4.6在今日Smoke评测中因API故障/超时导致execution与judgment维度数据缺失,已进入自动补跑,本期不参与主榜排名。材料约束维度得分为51.80分,任务表达维度得分为50.00分,其余维度记录为空。

数据事实:得分对比与缺失情况

昨日至今日对比显示,代码执行维度从无记录变为无记录,材料约束维度从无记录变为51.80分,工程判断维度从无记录变为无记录,任务表达维度从无记录变为50.00分,主榜从无记录变为无记录。Smoke评测每日仅10题,2题对应一个维度,单日分数波动属正常范围。

成因分析:API故障而非模型退化

得分对比中execution与judgment两维度完全缺失,直接指向API调用超时或故障,而非模型在代码执行或工程判断能力上的真实变化。材料约束51.80分与任务表达50.00分两个有记录的维度,均来自有限的2题抽样,在10题总量下样本量过小,容易受题目随机性影响。无证据显示模型在材料忠实度或任务表达上出现系统性退化,缺失本身即为技术层面的记录中断。

GLM-4.6今日Smoke评测材料约束51.80分、任务表达50.00分,其余维度因API故障缺失。

使用者含义:选型与依赖场景的具体影响

对重代码执行的团队而言,execution维度缺失意味着今日无法通过Smoke数据判断GLM-4.6在该场景下的可用性,需等待补跑结果。材料约束51.80分这一具体数值,对依赖模型严格遵循输入约束的企业提供参考:若当前应用对输出边界敏感,该分数提示需额外人工校验。任务表达50.00分则表明在任务指令解析环节,模型表现处于中等偏下区间,开发者在构建多步指令流水线时应预留容错机制。

  • 重材料约束场景的开发者应优先查看补跑后的完整execution得分,再决定是否升级生产环境。
  • 依赖任务表达的自动化流程需在今日数据基础上增加人工复核节点。

战略判断:关注完整性而非单日分数

基于得分对比,GLM-4.6本期异常主要由API故障造成,而非模型能力退化。单日10题快测的固有波动特性,使得51.80分与50.00分两个孤立数值不足以支撑模型真实性能下降的结论。需要关注的信号是数据完整性本身:连续出现API超时将直接影响后续Smoke评测的可比性。建议下一期重点验证补跑后的execution与judgment得分是否回归历史区间,以确认本次缺失为偶发事件。

对正在选型的团队,当前数据不支持将GLM-4.6从候选名单中移除,但要求在部署前完成多日完整Smoke记录的交叉验证。依赖该模型的开发者应将今日缺失视为运行信号,优先监控API可用性而非立即调整提示词策略。

Smoke评测每日波动正常,本次异常的核心在于维度缺失而非分数高低。基于现有对比,GLM-4.6需在补跑后重新进入排名观察,以确认材料约束51.80分与任务表达50.00分是否为稳定水平。


数据来源:赢政指数 (YZ Index) | Run #260 | 查看原始数据