GLM-4.6 在今日 Smoke 评测中诚信评级从 pass 直接变为 fail,代码执行维度从昨日 50.00 分升至 97.00 分,主榜整体从 62.83 分升至 74.00 分。
得分变化拆解
材料约束从 78.50 分降至 75.00 分,工程判断从 60.40 分降至 0.00 分,任务表达保持 50.00 分不变。核心主榜仅由代码执行与材料约束加权构成,因此代码执行 47 分的单日增幅直接拉高主榜 11.2 分。
可能成因分析
Smoke 评测每日仅 10 题,2 题/维度,单日抽签波动本身会造成较大分数摆动。代码执行从 50.00 分跃升 47 分,极可能源于今日抽中两道模型擅长的编程题目;工程判断直接归零则指向今日抽中的两道侧榜题目模型完全未能给出有效判断。材料约束仅小幅回落 3.5 分,任务表达零变化,说明模型在核心可审计维度上未出现系统性退化。
诚信评级从 pass 变为 fail 属于准入门槛事件,并非加分项。该变化最可能与工程判断 0.00 分直接相关,模型在侧榜题目中可能出现明显的事实编造或逻辑断裂,导致评测系统判定诚信不达标。
对使用者的具体含义
重代码执行的开发者团队今日可继续使用 GLM-4.6,其 97.00 分表现优于昨日,但需同步开启人工代码审查流程。依赖材料忠实度的场景应提高警惕,75.00 分的材料约束已低于昨日,且诚信评级 fail 意味着模型输出可能包含不可验证的内容。
对工程判断有强依赖的自动化流程(如需求评审、架构决策辅助)需立即切换至其他模型,0.00 分表明 GLM-4.6 在该类题目上已完全失效。
战略判断
基于现有得分对比,GLM-4.6 主榜上升主要由代码执行单维度驱动,并非整体能力提升。诚信评级 fail 与工程判断归零同时出现,指向单日题目抽签波动概率更高,而非模型真实退化。下一期 Smoke 评测需重点验证工程判断与诚信评级是否恢复,以确认波动性质。
目前数据不支持将 GLM-4.6 判定为持续性高估或低估,唯一明确信号是其在侧榜维度的极端不稳定表现值得持续跟踪。
数据来源:赢政指数 (YZ Index) | Run #241 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接