GPT-o3代码执行暴跌24.7分 主榜跌至78.13 Smoke评测异常需关注

GPT-o3在今日Smoke评测中,代码执行维度从昨日94.50分跌至69.80分,降幅24.7分,主榜整体从86.04分降至78.13分,降幅7.9分。

数据事实:维度分化明显

材料约束从75.70分升至88.30分,升幅12.6分。工程判断从97.00分跌至74.80分,降幅22.2分。任务表达从86.70分跌至70.80分,降幅15.9分。诚信评级维持pass。

成因分析:抽签波动概率更高

Smoke评测每日仅10题,2题/维度。代码执行与工程判断同时大跌,而材料约束逆势上升,表明题目抽签对不同维度的影响存在差异。代码执行与工程判断题目可能集中于复杂计算或多步推理场景,GPT-o3在这些具体题目上出现失误,导致分数集中下滑。材料约束得分上升,说明当日材料约束题目难度或类型更适合该模型当前能力。

若为模型真实退化,通常多个核心维度会同步走弱,而非出现材料约束大幅上升的补偿性表现。因此,题目抽签波动是更可能的原因。

对使用者的含义

重代码执行的团队在依赖GPT-o3处理算法实现或数据处理任务时,需增加人工复核环节。材料约束得分上升,意味着对来源忠实度要求高的文档生成或引用场景仍可继续使用。工程判断跌幅大,对需要多步决策的自动化流程,短期内应降低信任权重。

战略判断

基于单日数据,主榜下降主要由代码执行与工程判断拖累,材料约束的补偿表明模型整体能力未出现系统性退化。下一期评测若代码执行与工程判断同时回升,则确认本次为抽签波动;若持续低位,则需进一步验证。当前无需对GPT-o3整体能力下调结论,但重代码执行场景的使用者应提高警惕。

本次评测再次说明,Smoke评测单日波动幅度大,24.7分的代码执行降幅在小样本下属于可接受范围,但已接近需重点跟踪的阈值。材料约束的12.6分升幅提供了反向证据,支持波动而非退化的判断。

对选型企业而言,GPT-o3在材料约束维度的88.30分仍具竞争力,可在文档相关任务中作为备选。代码执行69.80分已低于多数主流模型日常水平,重度依赖代码生成的开发者应准备切换或并行验证方案。

工程判断74.80分与任务表达70.80分的同步下滑,进一步指向当日题目在推理链条上的集中失误,而非模型参数层面问题。诚信评级pass保持不变,排除了基础输出规范问题。

综合以上,GPT-o3本次Smoke评测异常最可能源于题目抽签波动,暂不构成模型真实退化的信号。建议下一期重点观察代码执行与工程判断是否同步回升,以确认趋势。


数据来源:赢政指数 (YZ Index) | Run #317 | 查看原始数据