GPT-o3在今日Smoke评测中,代码执行得分从昨日44.50分升至97.00分,材料约束得分从100.00分降至84.30分,主榜得分从69.48分升至91.29分。
得分变化的直接事实
代码执行维度单日上涨52.5分,材料约束维度单日下跌15.7分。工程判断保持100.00分不变,任务表达保持75.00分不变。诚信评级维持pass。主榜得分由代码执行与材料约束两个核心维度构成,今日主榜上升21.81分。
可能成因分析
Smoke评测每日仅10题,2题/维度,样本量小,单日波动属于正常范围。代码执行得分从44.50分大幅回升,显示该模型在今日抽中的代码类题目上表现稳定。材料约束得分下降15.7分,可能源于今日抽中的材料类题目对忠实度要求更高,或模型在特定约束场景下出现一次性偏差。
从维度构成看,材料约束下跌并未抵消代码执行的上涨,主榜仍实现净增长。这表明两个维度的题目抽签独立,今日材料约束的失分点集中于少数题目,而非全维度系统性退化。
对使用者的具体含义
重代码执行的团队在今日数据下可获得更高置信度,GPT-o3在代码生成与调试场景的可用性提升。依赖材料忠实度的场景,如合同抽取、长文档摘要、指令遵循类任务,则需额外验证输出是否出现约束违反。
企业选型时,单日材料约束84.30分仍处于可用区间,但低于昨日100.00分,建议在材料敏感项目中增加人工抽检环节。开发者若将GPT-o3嵌入自动化流程,今日数据提示需对材料输出增加二次校验规则。
战略判断
本次材料约束下跌更可能由题目抽签波动导致,而非模型真实退化。理由是代码执行出现对称性大幅回升,且工程判断与任务表达两个侧榜维度保持不变,整体系统未显示一致性下降信号。
若下期评测材料约束继续低于90分,则需进一步关注;若回升至95分以上,则可确认今日为孤立波动。当前数据不支持对GPT-o3材料约束能力进行长期下调判断。
数据来源:赢政指数 (YZ Index) | Run #248 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接