GLM-4.6代码执行跌12.5分 材料约束满分推主榜升5.4
GLM-4.6今日Smoke评测主榜79.38分,代码执行从75.00降至62.50,材料约束升至100.00,诚信评级从fail转为pass。单日10题抽签导致的波动最可能解释此变化,暂无模型真实退化信号。
GLM-4.6今日Smoke评测主榜79.38分,代码执行从75.00降至62.50,材料约束升至100.00,诚信评级从fail转为pass。单日10题抽签导致的波动最可能解释此变化,暂无模型真实退化信号。
GLM-4.6今日Smoke评测中诚信评级从pass降至fail,任务表达从45.00分跌至20.00分,主榜却从61.25分升至74.00分。代码执行提升25分,材料约束小涨3.3分,工程判断持平。单日10题抽签下,诚信门槛触发与任务表达
2026-W32 Smoke数据显示,Claude Sonnet 4.6从92.17跌至69.56,趋势-22.6;GLM-4.6波动达59.9且均值仅24.4;GPT-o3从89.2升至95.91,趋势+6.7。GPT-o3与Claude
今日Smoke评测中Grok 4材料约束从82.60分跌至65.00分,降幅17.6分,主榜从82.99分微降至81.23分。代码执行反升11.2分至94.50分,工程判断升至100分,诚信评级从pass转为warn。单日10题快测下,这一
今日Smoke评测中GLM-4.6材料约束从75.00降至47.70分,主榜却从46.29升至76.47分,代码执行从22.80升至100.00分,诚信评级从pass转为warn。单日10题快测下,维度剧烈波动值得关注。
2026-07-23 Run#243 中,GLM-4.6 主榜 55.74 分,代码执行 25.00 分,材料约束 93.30 分,诚信评级 fail(探针 30.00)。同日 11 个模型全部 pass,Gemini 2.5 Pro 探针
GLM-4.6 今日 Smoke 评测诚信评级降为 fail,代码执行从 50.00 分升至 97.00 分,主榜升至 74.00 分,工程判断从 60.40 分跌至 0.00 分,需关注单日 10 题波动与真实能力退化区别。
GPT-o3今日Smoke评测主榜从96.27分跌至87.94分,降幅8.3分。代码执行单日下跌11.7分至88.30,工程判断下跌19.8分至75.00,诚信评级从pass转为warn。数据揭示单日波动与一致性风险。
Qwen3 Max今日Smoke评测主榜从82.23分跌至67.31分,代码执行维度从96.90分暴跌31.3分至65.60分,工程判断(侧榜)从36.30分降至11.30分,诚信评级从pass转为warn。材料约束小幅回升5.1分。
2026-07-08至2026-07-12 Smoke评测显示,Gemini 2.5 Pro趋势上升34.3分至94.24分,豆包Pro上升20.2分至91.99分;GLM-4.6波动达40.5分且诚信评级从fail转为warn,GPT-o
Grok 4 今日 Smoke 评测主榜从 87.66 分跌至 79.30 分,降幅 8.4 分,主要源于材料约束从 79.30 分跌至 61.70 分。代码执行仅降 0.8 分,工程判断反升 15.3 分,诚信评级从 pass 转为 wa
GLM-4.6 在 2026-07-05 Run#214 Smoke 快测中主榜 60.04 分,代码执行 88.70 分、材料约束 25.00 分,诚信评级 fail(探针 0.00)。该模型在 42 个金丝雀探针中全部触发,显示其将虚构
2026-W26 Smoke日测数据显示,文心一言4.5从98.74跌至61.52,趋势-37.2;Claude Sonnet 4.6、Claude Opus 4.7波动分别达28.4和28.5。豆包Pro持平,诚信评级改善模型仅两家。数据
Qwen3 Max今日Smoke评测主榜从85.96分跌至74.00分,代码执行持平100.00分,材料约束从68.80分升至95.70分,但工程判断和任务表达双双大跌,诚信评级由pass转为fail。
今日Smoke评测显示Claude Sonnet 4.6以91.77分登顶,代码执行满分、材料约束81.7分;GPT-o3执行仅50分垫底11名;DeepSeek V4 Pro诚信评级突降为fail,11模型中仅3个pass。
Claude Opus 4.7今日Smoke评测主榜从96.76跌至88.53,材料约束单日暴跌18.3分至74.50,诚信评级从pass转为warn,工程判断小幅回升。
DeepSeek V4 Pro 在今日 Smoke 评测中诚信评级从 Fail 直接转为 Pass,主榜从 74.00 跃升至 97.08,材料约束单项上涨 23.5 分。单日 10 题快测下,这种幅度变化究竟是抽签运气还是真实能力回暖,需
GPT-5.5 本周 Smoke 成绩从60.58飙升至90.3,涨幅29.7分领跑;GPT-o3 则从94.51 断崖下跌至58.08,降幅36.4分最惨。Gemini 2.5 Pro 波动61.1分暴露一致性问题,DeepSeek V4
Gemini 2.5 Pro今日Smoke评测主榜从96.63骤降至74,工程判断从66.7跌至30,任务表达从50跌至10,诚信评级直接转为fail。单日10题快测的抽签波动是否掩盖了模型真实能力退化,值得重点关注。
文心一言4.5今日Smoke评测中诚信评级从pass直接变为fail,主榜得分却从67.46升至74.00。代码执行从50分跃升至92.5分,但工程判断和任务表达分别暴跌36.7分和40分,显示模型在一致性与指令遵循上出现明显退化。