GPT-5.5 Smoke评测主榜暴跌10.1分 材料约束单日掉16.3

GPT-5.5在今日Smoke评测中主榜得分从98.35分跌至88.27分,降幅达到10.1分。

得分变化拆解

代码执行维度从97.00分降至92.00分,材料约束维度从100.00分降至83.70分,工程判断维度维持75.00分,任务表达维度从91.70分降至81.70分。主榜仅由代码执行与材料约束两个维度加权构成,因此材料约束的16.3分跌幅直接拉低整体得分。

可能成因分析

Smoke评测每日仅抽取2题/维度,样本量小,单日波动属于正常范围。材料约束维度跌幅最大,说明当日抽中的2道材料约束题目可能包含更高难度的忠实度要求或边缘案例,导致模型输出偏离约束。代码执行维度仅降5分,降幅相对温和,提示代码相关题目难度分布较为平稳。工程判断维度零变化,表明该侧榜维度受当日题目影响较小。任务表达维度下降10分,可能与材料约束题目中隐含的表达要求叠加。

题目抽签波动与模型真实退化两种解释均有可能。当前数据仅显示单日截面,无法区分二者。若后续多日材料约束持续低于90分,则更接近真实能力变化;若单日反弹,则更可能是抽签所致。

对使用者的含义

重代码执行的团队需注意,GPT-5.5当日代码执行仍保持92.00分,短期内可用作代码生成辅助,但需增加人工校验环节以应对潜在5分级别的波动。对材料忠实度敏感的场景,如合同抽取、知识库问答,83.70分的材料约束得分意味着输出偏离约束的风险上升,建议在生产流程中加入二次校验或回退机制。

工程判断维度稳定在75.00分,对依赖该侧榜的架构决策场景影响有限。任务表达维度81.70分,提示需要更清晰的提示词工程来维持输出结构。

战略判断

基于单日数据,GPT-5.5主榜得分被当日材料约束题目放大,当前88.27分可能低估其常态水平,也可能反映真实波动。建议下期重点验证材料约束维度是否回升至95分以上。若连续两日材料约束低于85分,则需重新评估其在高约束场景的优先级。

工程判断保持不变,说明模型在该侧榜的能力相对稳健,可作为对比基准。整体而言,此次跌幅主要由材料约束单维度驱动,尚未构成多维度系统性退化信号。

材料约束从100.00分跌至83.70分是本次主榜暴跌的核心驱动因素。

对于依赖GPT-5.5的开发者,短期策略是增加材料约束相关测试用例的覆盖密度,观察连续三日得分标准差。若标准差超过8分,则稳定性维度将进一步承压。

本次Smoke评测结果显示,GPT-5.5在材料约束维度出现明显单日波动,代码执行维度相对抗跌。企业选型时应将材料约束作为独立监控指标,而非仅参考主榜均值。


数据来源:赢政指数 (YZ Index) | Run #286 | 查看原始数据