GPT-o3在今日Smoke评测中,主榜得分从昨日96.27分跌至87.94分,降幅达到8.3分。代码执行维度从100.00分跌至88.30分,材料约束从91.70分跌至87.50分,工程判断从94.80分跌至75.00分,任务表达从75.00分升至90.00分,诚信评级从pass变为warn。
得分变化拆解
代码执行维度跌幅最大,单日损失11.7分。材料约束损失4.2分。工程判断损失19.8分,任务表达反而上升15分。主榜由代码执行与材料约束加权构成,因此整体下降8.3分直接反映这两个维度的共同下滑。
可能成因分析
Smoke评测每日仅10题,2题 per 维度,抽签波动是首要可能因素。代码执行昨日两题均得满分,今日两题得分下降,说明题目难度或覆盖场景出现差异。工程判断跌幅最大,可能当日题目更侧重多步推理或约束冲突,暴露模型在该侧榜维度的不稳定。材料约束小幅下降,表明模型对给定材料忠实度仍有一定波动。任务表达上升则显示当日题目更易于模型组织表达。
真实退化与抽签波动的区分需看连续多日数据。目前仅单日对比,无法确认模型能力是否系统性下降。诚信评级转为warn,提示模型在部分回答中出现一致性或合规性问题,这与工程判断大幅下跌可能存在关联。
对使用者的具体含义
重度依赖代码执行的开发者团队需提高警惕。昨日满分表现可能掩盖潜在风险,今日88.30分意味着在复杂代码生成或调试场景中,模型出错概率上升。材料约束87.50分对需要严格遵循文档或规范的场景构成轻度压力。工程判断75.00分提示在需要工程权衡的决策任务中,模型判断可靠性降低。
任务表达90.00分对内容生成类任务影响较小。诚信评级warn则要求企业在生产环境部署前增加人工审核环节,避免模型输出出现边界违规。
战略判断
基于现有单日数据,GPT-o3主榜得分下降主要由代码执行与工程判断波动驱动。抽签题目差异是更可能解释,但工程判断19.8分跌幅已超出正常单日范围,值得下期继续追踪。若连续两日工程判断与代码执行均维持低位,则需考虑模型在复杂约束场景下的真实一致性问题。
目前数据不支持对模型整体能力的长期结论,仅显示当日Smoke评测中,GPT-o3在代码执行和工程判断两个维度出现明显波动。依赖该模型的团队应在下一轮评测结果公布后,再决定是否调整使用策略。
数据来源:赢政指数 (YZ Index) | Run #241 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接