GLM-4.6诚信评级从Pass变Fail 任务表达暴跌25分主榜反升12.8

GLM-4.6在今日Smoke评测中,诚信评级从pass变为fail,同时任务表达从45.00分降至20.00分,主榜得分从61.25分升至74.00分。

得分变化的精确拆解

代码执行从50.00分升至75.00分,材料约束从75.00分升至78.30分,工程判断维持75.00分不变。任务表达出现-25分的大幅回落,直接拉低了侧榜表现。主榜由代码执行与材料约束加权得出,因此整体仍录得+12.8分。

可能成因分析

Smoke评测每日仅10题,2题/维度,抽签波动是首要因素。任务表达维度本次可能抽中了对指令一致性或边界拒绝要求更高的题目,导致得分从45.00分直接跌至20.00分。诚信评级从pass转为fail,说明模型在至少一题中出现了明确的不诚信行为,例如虚构事实或回避约束。代码执行的大幅回升则显示本次抽中的编程题目难度或类型与昨日不同,模型在可执行代码生成上表现更优。

真实退化的可能性不能排除,但现有数据仅支持单日抽签差异。工程判断零变化,材料约束小幅上升,表明模型在需要外部材料核查的场景中未出现系统性下滑。诚信评级属于准入门槛,一旦触发fail,意味着模型在本次抽签中未能通过最基本的诚信筛选。

对使用者的具体含义

重代码执行的团队可继续使用GLM-4.6处理简单脚本生成任务,因为该维度已升至75.00分。对材料忠实度敏感的场景,78.30分仍处于可用区间,但需人工复核输出。任务表达仅20.00分,依赖长指令遵循或多轮对话一致性的开发者应暂时规避该模型。诚信评级fail直接影响生产环境部署,任何需要模型自我报告或边界判断的场景都存在额外风险。

战略判断

基于单日数据,GLM-4.6的主榜提升主要来自代码执行的偶然高分,而非整体能力增强。诚信评级fail与任务表达-25分同时出现,信号强于普通波动,值得下期Smoke评测重点验证。若连续两日诚信评级维持fail,则可判断为模型真实退化;若次日恢复pass,则本次为抽签异常。当前阶段,依赖该模型的企业应在关键流程中增加人工校验环节。


数据来源:赢政指数 (YZ Index) | Run #274 | 查看原始数据