GPT-o3主榜暴跌15分 代码执行从100跌至75
GPT-o3今日Smoke评测主榜从85.15分跌至70.19分,代码执行单维度暴跌25分至75分,材料约束微降2.7分。工程判断保持满分,任务表达升至100分。单日10题快测下,此类波动需区分抽签与真实退化。
GPT-o3今日Smoke评测主榜从85.15分跌至70.19分,代码执行单维度暴跌25分至75分,材料约束微降2.7分。工程判断保持满分,任务表达升至100分。单日10题快测下,此类波动需区分抽签与真实退化。
GPT-o3今日Smoke评测代码执行从94.50分跌至69.80分(-24.7),主榜从86.04分降至78.13分(-7.9)。材料约束反升12.6分至88.30,工程判断跌22.2分。单日10题快测下,此波动幅度超出常规,需判断是抽签
GPT-o3今日Smoke评测中材料约束从70.00分跌至50.00分,工程判断从100.00分跌至50.00分,但代码执行从75.00分升至100.00分,主榜从72.75分升至77.50分。单日10题测试下,材料约束与工程判断同步大跌,
GPT-o3今日Smoke评测主榜从100.00跌至89.92分,材料约束从100.00骤降至77.60分(-22.4),代码执行维持100.00分,工程判断升至95.80分。单日10题快测中材料约束维度2题表现拉低整体,需观察是否为抽签波
本期WDCD v3.1测试中,Claude Sonnet 4.6较Run #291上涨13.5分升至91.60分,Gemini 2.5 Pro下跌12.5分,Grok 4以96.30分继续领跑。3升4降格局下,守约能力分化加剧,对生产流程接
GPT-o3今日Smoke评测主榜从96.93分跌至87.93分,下降9分。材料约束维度从95.00分骤降至75.00分,工程判断升至75.00分,任务表达升至91.70分。代码执行维持98.50分,诚信评级仍为pass。
2026-W32 Smoke数据显示,Claude Sonnet 4.6从92.17跌至69.56,趋势-22.6;GLM-4.6波动达59.9且均值仅24.4;GPT-o3从89.2升至95.91,趋势+6.7。GPT-o3与Claude
本期WDCD v3.1测试中,GPT-o3上升9.5分、Gemini 2.5 Pro上升7.6分,GLM-4.6下降14.9分、Claude Sonnet 4.6下降10.8分。Grok 4以97.50分保持首位,11模型中3降2升,守约能
GPT-o3在今日Smoke评测中主榜从93.16分跌至79.28分,暴跌13.9分。代码执行从95.00降至81.80,材料约束从90.90降至76.20,工程判断侧榜更跌30.6分至63.90。任务表达侧榜升至100.00。诚信评级维持
GPT-o3今日Smoke评测中代码执行从44.50升至97.00,材料约束从100.00降至84.30,主榜从69.48升至91.29。材料约束单日下跌15.7分,需判断是抽签波动还是真实退化。
GPT-o3今日Smoke评测主榜从96.27分跌至87.94分,降幅8.3分。代码执行单日下跌11.7分至88.30,工程判断下跌19.8分至75.00,诚信评级从pass转为warn。数据揭示单日波动与一致性风险。
GPT-o3今日Smoke评测主榜从80.61分跌至66.86分,代码执行维度从70.30分降至48.50分,跌幅21.8分,材料约束小降3.9分,工程判断反升22分。
2026-07-13 至 2026-07-19 期间,Claude Opus 4.7 均值 86.9 分且波动仅 20.9,GPT-o3 均值 71.1 分、波动 97.4,豆包 Pro 下跌 47.5 分。Claude 系列两款模型均呈上
本期WDCD v3.1数据显示,Claude Sonnet 4.6较Run #227上涨15分,GLM-4.6下跌15.3分,11个模型中3升4降。GPT-o3以94.00分保持首位,Grok 4位列第二但下滑7.1分,守约能力分化加剧。
今日Smoke评测中GPT-o3材料约束从83.60分跌至66.80分,任务表达从95.00分跌至66.70分,主榜整体下滑3.1分至80.39分。代码执行反升8.2分,工程判断持平75.00分,诚信评级维持pass。
GPT-o3今日Smoke评测材料约束从100.00分跌至84.80分,主榜从100.00降至93.16分。代码执行、工程判断、任务表达三项保持满分,诚信评级维持pass。单日10题快测下,此类波动是否反映真实退化值得追踪。
v6评测中GPT-o3主榜上涨7分至82.82,但蓄水池采样严格题从100分直接归零。工程判断却暴涨50.3分,材料约束提升14分,稳定性从33.8升至58.0。原始回答仅写到“if j < k:”便截断,暴露算法实现一致性缺陷。
今日Smoke轻量评测中,文心一言4.5执行分直接腰斩至50,主榜暴跌11分至62.96。GPT-o3单日主榜暴涨35.8分,Claude Opus 4.7以99.42分继续领跑,材料约束成为拉开差距的关键。
GPT-o3今日Smoke评测主榜从76.05跌至58.08,代码执行从90.00直接腰斩至47.50,工程判断也从50跌到10。单日抽题波动虽属正常,但这一量级的断崖式下跌已超出随机范围,值得重点追踪。
今日Smoke轻量评测显示,GPT-o3主榜暴跌18分至58.08,执行分直接腰斩;豆包Pro、Gemini 3.1 Pro分别暴涨35.8和34.7分,快速挤入前五。GPT-5.5以90.3继续领跑,文心一言诚信评级降至warn。