GPT-o3 Smoke评测主榜暴跌10.1分 材料约束单日崩22.4分

GPT-o3在今日Smoke评测中主榜得分从昨日100.00分跌至89.92分,降幅10.1分,主要由材料约束维度从100.00分降至77.60分导致。

得分明细与直接对比

代码执行维度昨日与今日均为100.00分,无变化。材料约束维度昨日100.00分、今日77.60分,降幅22.4分。工程判断维度从75.00分升至95.80分,升幅20.8分。任务表达维度从90.00分降至85.00分,降幅5分。诚信评级维持pass。

成因分析:抽签波动还是真实退化

Smoke评测每日仅2题/维度,材料约束维度今日2题得分直接拉低该维度22.4分。代码执行维度2题仍保持满分,说明模型在代码相关任务上未出现系统性问题。工程判断维度反而提升20.8分,表明模型在该侧榜任务上的表现有所改善。任务表达小幅回落5分,幅度有限。综合看,材料约束的单日大跌最可能源于今日抽签到的2题对材料忠实度要求较高,模型在引用或约束遵守上出现扣分,而非整体能力退化。

对使用者的具体含义

重代码执行的团队可继续依赖GPT-o3,该维度连续两日满分,执行稳定性未受影响。对材料忠实度敏感的场景(如合同抽取、文献总结、数据引用任务),今日77.60分提示需增加人工校验环节,避免模型输出偏离给定材料。工程判断侧榜升至95.80分,对需要模型辅助方案评估的开发者而言,今日表现优于昨日。

战略判断

主榜10.1分跌幅完全由材料约束单维度22.4分拖累,其他核心维度未同步恶化,因此无需立即判定模型整体退化。下一期Smoke评测若材料约束维度继续出现类似低分,则需重点验证;若恢复至95分以上,则可判断今日为抽签波动。当前数据支持的结论是:材料约束维度成为GPT-o3短期观察重点,代码执行维度仍保持满分优势。


数据来源:赢政指数 (YZ Index) | Run #298 | 查看原始数据