DeepSeek V4 Pro代码执行暴跌25分 主榜下滑6.7分
今日Smoke评测中,DeepSeek V4 Pro代码执行从100.00跌至75.00,主榜从83.53降至76.85。材料约束升至79.10,工程判断升至100.00,任务表达降至74.20,诚信评级从warn转为pass。单日10题快
今日Smoke评测中,DeepSeek V4 Pro代码执行从100.00跌至75.00,主榜从83.53降至76.85。材料约束升至79.10,工程判断升至100.00,任务表达降至74.20,诚信评级从warn转为pass。单日10题快
Grok 4今日Smoke评测主榜从89.30分跌至78.01分,降幅11.3分。其中材料约束从78.90分骤降至60.90分,代码执行从97.80分降至92.00分,工程判断则从81.90分升至94.50分。单日波动主要集中在材料约束维度
DeepSeek V4 Pro今日Smoke评测中材料约束从100分跌至68.2分,降31.8分;代码执行从69.5分升至100分,主榜反而升2.46分至85.69。单日2题抽样导致的剧烈波动是主因,诚信评级仍为pass。
GPT-o3今日Smoke评测中代码执行从44.50升至97.00,材料约束从100.00降至84.30,主榜从69.48升至91.29。材料约束单日下跌15.7分,需判断是抽签波动还是真实退化。
2026-07-23 Run#243 中,GLM-4.6 主榜 55.74 分,代码执行 25.00 分,材料约束 93.30 分,诚信评级 fail(探针 30.00)。同日 11 个模型全部 pass,Gemini 2.5 Pro 探针
GLM-4.6 今日 Smoke 评测诚信评级降为 fail,代码执行从 50.00 分升至 97.00 分,主榜升至 74.00 分,工程判断从 60.40 分跌至 0.00 分,需关注单日 10 题波动与真实能力退化区别。
今日Smoke评测中,Claude Opus 4.7主榜得分从100.00分跌至73.92分,降幅26.1分。代码执行从100.00降至75.00,材料约束从100.00降至72.60,工程判断与任务表达降幅较小,诚信评级维持pass。
Gemini 3.1 Pro今日Smoke评测材料约束从90.40分跌至72.60分,降幅17.8分,主榜从81.93分降至75.90分。代码执行小升3.6分,工程判断升至100分,任务表达跌25分。单日10题测试中,此幅度变化需重点观察。
Gemini 2.5 Pro今日Smoke评测代码执行从74.60分跌至50.00分,材料约束升至94.40分,主榜从76.49分降至69.98分。单日10题测试中,代码执行维度出现最大波动,需区分题目抽签与真实能力变化。
Gemini 3.1 Pro今日Smoke评测材料约束从90.90分跌至64.30分,降26.6分;代码执行从18.40分升至50.00分,主榜从51.03分升至56.44分。单日10题抽样下,材料约束与任务表达同步回落,需观察后续一致性。
Grok 4今日Smoke评测主榜从94.15分跌至76.65分,降幅17.5分。其中材料约束从87.00分跌至65.10分,代码执行从100.00分跌至86.10分。单日10题抽签导致的波动与模型真实能力退化需进一步验证。
Gemini 3.1 Pro 今日 Smoke 评测主榜从 80.99 分跌至 72.50 分,降幅 8.5 分。其中代码执行维度从 75.00 分腰斩至 50.00 分,材料约束反而升至 100.00 分,工程判断(侧榜,AI 辅助评估)
Claude Opus 4.7今日Smoke评测主榜从96.99分跌至82.95分,代码执行维度从100.00分降至69.00分,材料约束升至100.00分。单日2题抽签导致的波动是主因。
GLM-4.6今日Smoke评测材料约束从50.00分跌至25.00分,降幅25分;代码执行从25.00分升至75.00分,主榜从36.25分升至52.50分。工程判断同步下滑19.5分。单日10题抽样下,需区分题目波动与真实能力变化。
Grok 4 今日 Smoke 评测主榜从 87.66 分跌至 79.30 分,降幅 8.4 分,主要源于材料约束从 79.30 分跌至 61.70 分。代码执行仅降 0.8 分,工程判断反升 15.3 分,诚信评级从 pass 转为 wa
今日Smoke评测中GPT-o3材料约束从83.60分跌至66.80分,任务表达从95.00分跌至66.70分,主榜整体下滑3.1分至80.39分。代码执行反升8.2分,工程判断持平75.00分,诚信评级维持pass。
Qwen3 Max今日Smoke评测中材料约束从83.60分跌至68.50分,降幅15.1分,代码执行则从73.10分升至91.50分,主榜小幅升至81.15分。单日2题抽样导致的波动仍是主因,需持续观察下一期数据以确认是否为真实能力退化。
GLM-4.6 在 2026-07-05 Run#214 Smoke 快测中主榜 60.04 分,代码执行 88.70 分、材料约束 25.00 分,诚信评级 fail(探针 0.00)。该模型在 42 个金丝雀探针中全部触发,显示其将虚构
2026-07-04 Smoke轻量评测中,Gemini 2.5 Pro以主榜96.99分(执行100、约束93.3)登顶,Qwen3 Max主榜暴跌12.9分至72.02。GPT-o3与Gemini 2.5 Pro单日分别上涨24分和22
2026-07-02 Smoke 评测显示,Gemini 3.1 Pro 以主榜 82.97 分(执行 75、约束 92.7)位居第一,豆包 Pro 81.98 分紧随其后。Claude Opus 4.7 约束 97 分最高,但执行仅 58