GLM-4.6代码执行跌12.5分 材料约束满分推主榜升5.4
GLM-4.6今日Smoke评测主榜79.38分,代码执行从75.00降至62.50,材料约束升至100.00,诚信评级从fail转为pass。单日10题抽签导致的波动最可能解释此变化,暂无模型真实退化信号。
GLM-4.6今日Smoke评测主榜79.38分,代码执行从75.00降至62.50,材料约束升至100.00,诚信评级从fail转为pass。单日10题抽签导致的波动最可能解释此变化,暂无模型真实退化信号。
GLM-4.6今日Smoke评测中诚信评级从pass降至fail,任务表达从45.00分跌至20.00分,主榜却从61.25分升至74.00分。代码执行提升25分,材料约束小涨3.3分,工程判断持平。单日10题抽签下,诚信门槛触发与任务表达
GLM-4.6今日Smoke评测因API故障导致代码执行与诚信维度缺失,仅材料约束71.90分、工程判断63.90分、任务表达50.00分,主榜不参与排名。单日10题测试波动属正常,但缺失维度指向接口层面问题而非模型能力退化。
本期WDCD v3.1测试中,GPT-o3上升9.5分、Gemini 2.5 Pro上升7.6分,GLM-4.6下降14.9分、Claude Sonnet 4.6下降10.8分。Grok 4以97.50分保持首位,11模型中3降2升,守约能
GLM-4.6今日Smoke评测因API故障/超时,execution与judgment维度数据缺失,自动进入补跑,本期不参与排名。材料约束得分51.80分,任务表达50.00分,其余维度为空。单日10题快测波动属正常,但完整性受损需关注。
GLM-4.6今日Smoke评测因API故障/超时导致integrity与communication维度缺失,主榜得分74.00,代码执行82.30,材料约束95.00,工程判断70.80,任务表达无数据,已进入自动补跑且不参与本期排名。
今日Smoke评测中GLM-4.6材料约束从75.00降至47.70分,主榜却从46.29升至76.47分,代码执行从22.80升至100.00分,诚信评级从pass转为warn。单日10题快测下,维度剧烈波动值得关注。
2026-07-23 Run#243 中,GLM-4.6 主榜 55.74 分,代码执行 25.00 分,材料约束 93.30 分,诚信评级 fail(探针 30.00)。同日 11 个模型全部 pass,Gemini 2.5 Pro 探针
GLM-4.6 今日 Smoke 评测诚信评级降为 fail,代码执行从 50.00 分升至 97.00 分,主榜升至 74.00 分,工程判断从 60.40 分跌至 0.00 分,需关注单日 10 题波动与真实能力退化区别。
本期WDCD v3.1数据显示,Claude Sonnet 4.6较Run #227上涨15分,GLM-4.6下跌15.3分,11个模型中3升4降。GPT-o3以94.00分保持首位,Grok 4位列第二但下滑7.1分,守约能力分化加剧。
GLM-4.6今日Smoke评测材料约束从50.00分跌至25.00分,降幅25分;代码执行从25.00分升至75.00分,主榜从36.25分升至52.50分。工程判断同步下滑19.5分。单日10题抽样下,需区分题目波动与真实能力变化。
2026-07-08至2026-07-12 Smoke评测显示,Gemini 2.5 Pro趋势上升34.3分至94.24分,豆包Pro上升20.2分至91.99分;GLM-4.6波动达40.5分且诚信评级从fail转为warn,GPT-o
GLM-4.6 在 2026-07-05 Run#214 Smoke 快测中主榜 60.04 分,代码执行 88.70 分、材料约束 25.00 分,诚信评级 fail(探针 0.00)。该模型在 42 个金丝雀探针中全部触发,显示其将虚构