GLM-4.6 在 2026-10-02 的赢政指数 Smoke 快测中,主榜得分 67.94 分,代码执行 41.70 分,材料约束 100.00 分,诚信评级 fail(探针得分 15.00)。
分数结构反差最突出
材料约束 100.00 分与代码执行 41.70 分形成明显反差。材料约束满分表明模型在给定长文档内引用核验任务中能严格遵循材料并正确标注来源。代码执行 41.70 分则显示真实 Python 沙箱运行通过率偏低,低于当日多款模型的代码执行表现。
诚信评级 fail 是独立信号。42 个金丝雀探针检测到模型将虚构实体当作真实引用来源,探针得分仅 15.00 分。当日 Claude Opus 4.7、Gemini 2.5 Pro、Gemini 3.1 Pro 探针得分均为 90.00 分,GPT-6 Sol 探针得分 80.00 分,DeepSeek V4 Pro 探针得分 80.00 分,GLM-4.6 是唯一 fail 模型。
探针触发机制分析
诚信探针与材料约束维度独立。材料约束考察模型是否基于给定材料回答,GLM-4.6 该项满分说明其在受控材料内表现规范。探针 fail 则指向模型在回答中主动编造外部来源或虚构实体引用,与题目难度无关。
历史记录显示 GLM-4.6 此前在 2026-09-29 Run#343 也曾触发 fail(探针 25.00),2026-10-01 Run#354 转为 pass(探针 90.00)。本次再次 fail,表明诚信问题出现反复。
对使用者的具体含义
重代码执行的团队需注意 GLM-4.6 41.70 分的通过率。需要频繁运行 Python 脚本、数据处理或算法验证的场景中,该模型出错概率较高。
对材料忠实度敏感的场景,GLM-4.6 材料约束 100.00 分提供一定保障。但诚信 fail 意味着在需要外部引用或来源核查的任务中,模型可能插入虚构实体或错误来源,增加后续人工核验成本。
依赖模型生成报告或技术文档的开发者,应额外增加来源验证环节。探针得分 15.00 分的低分直接反映了该风险。
战略判断
GLM-4.6 在材料约束维度达到满分,显示其在受控输入下的引用能力已达较高水平。但代码执行 41.70 分与诚信 fail 共同构成明显短板,使其在需要高一致性与可验证输出的场景中处于劣势。
当日其余 13 个模型诚信评级均为 pass 或 warn,GLM-4.6 是唯一 fail 案例。该信号值得在后续 Smoke 快测中持续跟踪,观察其代码执行与诚信探针得分的波动情况。
基于现有数据,GLM-4.6 更适合材料约束要求高、代码执行需求低的特定任务。对同时需要可靠代码运行与可信来源的团队,当前得分结构显示其并非最优选择。
数据来源:赢政指数 (YZ Index) | Run #356 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接