Gemini 2.5 Pro 主榜从18.37跃至83.39,材料约束12.1直达100
Gemini 2.5 Pro今日Smoke评测主榜升至83.39分,代码执行从23.50升至69.80,材料约束从12.10升至100.00,诚信评级从fail转为pass。单日10题测试下,如此大幅波动最可能源于题目抽签差异,而非模型本身
Gemini 2.5 Pro今日Smoke评测主榜升至83.39分,代码执行从23.50升至69.80,材料约束从12.10升至100.00,诚信评级从fail转为pass。单日10题测试下,如此大幅波动最可能源于题目抽签差异,而非模型本身
GPT-5.5今日Smoke评测主榜从98.35分跌至88.27分,降幅10.1分。其中材料约束从100.00分跌至83.70分,代码执行从97.00分跌至92.00分。工程判断保持75.00分不变,任务表达下降10分,诚信评级维持pass
Claude Opus 4.7今日Smoke评测主榜从98.35分跌至90.16分,材料约束从100.00暴跌至87.90,代码执行降5分。单日10题测试下,材料约束维度成为最大拖累。
豆包 Pro 今日 Smoke 评测中材料约束从90.90分跌至50.00分,代码执行从75.00分升至100.00分,主榜从82.16分降至77.50分。单日10题测试下,材料约束暴跌40.9分成为主因,需区分题目抽签波动与真实能力退化。
GPT-o3今日Smoke评测主榜从96.93分跌至87.93分,下降9分。材料约束维度从95.00分骤降至75.00分,工程判断升至75.00分,任务表达升至91.70分。代码执行维持98.50分,诚信评级仍为pass。
豆包 Pro 今日 Smoke 评测主榜从94.74分跌至82.16分,代码执行从100.00分降至75.00分,材料约束微升至90.90分。单日10题抽样导致的波动是主因,工程判断与任务表达保持稳定,诚信评级仍为pass。
Qwen3 Max今日Smoke评测主榜从95.34分跌至86.98分,降幅8.4分。其中材料约束从93.30分跌至76.80分,降16.5分,工程判断与任务表达侧榜跌幅更大。数据指向题目抽签波动与模型在特定约束场景下的不稳定。
DeepSeek V4 Pro今日Smoke评测主榜从70.44分跌至51.24分,代码执行从66.70分直接跌至25.00分,材料约束反而升至83.30分。单日41.7分降幅远超正常抽签波动范围,需持续观察。
今日Smoke评测中,Claude Sonnet 4.6代码执行从100.00分降至75.00分,材料约束从56.70分升至75.00分,主榜从80.52分跌至75.00分。工程判断(侧榜,AI辅助评估)从100.00分降至60.50分。单
Claude Opus 4.7今日Smoke评测代码执行从99.60分跌至75.00分,材料约束从61.70分升至100.00分,主榜从82.55分升至86.25分。工程判断降11.1分,任务表达持平。单日10题抽样波动或为主要原因,需持续
DeepSeek V4 Pro今日Smoke评测因API故障导致代码执行维度数据缺失,材料约束得分55.60分,工程判断50.00分,任务表达62.50分,主榜未参与排名。单日10题快测波动正常,但执行维度完全缺测需重点关注。
GPT-5.5今日Smoke评测中材料约束从65.80分跌至50.60分,降15.2分;代码执行从45.00分升至75.00分,涨30分;主榜从54.36分升至64.02分。工程判断升25分,任务表达降8.3分。诚信评级维持pass。
Gemini 2.5 Pro今日Smoke评测主榜79.41分,较昨日下降9.1分。其中代码执行从99.60暴跌至70.00,材料约束则升至90.90。单日10题抽样导致的波动值得持续观察。
GLM-4.6今日Smoke评测主榜79.38分,代码执行从75.00降至62.50,材料约束升至100.00,诚信评级从fail转为pass。单日10题抽签导致的波动最可能解释此变化,暂无模型真实退化信号。
GLM-4.6今日Smoke评测中诚信评级从pass降至fail,任务表达从45.00分跌至20.00分,主榜却从61.25分升至74.00分。代码执行提升25分,材料约束小涨3.3分,工程判断持平。单日10题抽签下,诚信门槛触发与任务表达
Qwen3 Max今日Smoke评测主榜从96.04分跌至85.82分,降幅10.2分。其中材料约束从91.20分跌至69.70分,降幅21.5分;代码执行仅降1分。任务表达侧榜反升32.2分。数据指向材料约束维度异常波动。
DeepSeek V4 Pro今日Smoke评测材料约束从89.50分跌至70.00分,主榜从94.07降至86.50分,代码执行反升至100.00分。单日2题抽样导致的波动需重点关注。
今日Smoke评测中,Claude Sonnet 4.6代码执行从94.50分跌至75.00分,材料约束从43.30分升至97.80分,主榜从71.46分升至85.26分。仅2题抽样导致的波动是主因,整体能力未见系统性退化。
今日Smoke评测中Grok 4材料约束从82.60分跌至65.00分,降幅17.6分,主榜从82.99分微降至81.23分。代码执行反升11.2分至94.50分,工程判断升至100分,诚信评级从pass转为warn。单日10题快测下,这一
GLM-4.6今日Smoke评测因API故障导致代码执行与诚信维度缺失,仅材料约束71.90分、工程判断63.90分、任务表达50.00分,主榜不参与排名。单日10题测试波动属正常,但缺失维度指向接口层面问题而非模型能力退化。