GPT-6 Sol材料约束暴跌33.3分 代码执行反升25分主榜微降

GPT-6 Sol在今日Smoke评测中材料约束得分从88.30分降至55.00分,降幅达到33.3分,主榜得分仅从80.99分微降至79.75分。

得分对比数据

代码执行从75.00分升至100.00分,升幅25分;材料约束从88.30分降至55.00分;工程判断维持94.80分不变;任务表达从100.00分降至77.50分,降幅22.5分;诚信评级维持pass。

数据事实拆解

主榜由代码执行与材料约束两个维度加权构成。代码执行满分100.00分直接拉高主榜,而材料约束55.00分则形成对冲,导致整体仅下降1.2分。任务表达作为侧榜维度同步出现22.5分回落,显示模型在本次10题快测中对指令忠实度的响应出现不一致。

成因分析

Smoke评测每日仅2题/维度,题目抽签随机性可能导致单日分数剧烈波动。材料约束55.00分与昨日88.30分的差距,可能是本次抽取题目对材料引用要求更高,而模型未能保持一致输出。代码执行升至100.00分则显示模型在本次代码类题目上表现稳定,未出现同类退化。两种维度反向变动更接近题目抽签波动,而非模型整体能力退化。

对使用者的含义

重材料约束的场景如合同审查、文献引用生成,企业需额外增加人工校验环节,避免55.00分水平下的输出偏差。依赖代码执行的开发者可继续使用GPT-6 Sol处理编程任务,本次100.00分表现提供短期信心。任务表达77.50分提示在多轮指令场景中,模型可能出现指令遗漏,建议拆分复杂任务以降低风险。

战略判断

材料约束单日33.3分跌幅超出正常波动范围,值得下期Smoke评测重点跟踪。若连续两日材料约束维持在60分以下,则需考虑模型在 grounding 维度出现系统性问题。当前主榜79.75分仍处于可用区间,但对材料忠实度敏感的团队应准备备选模型。工程判断94.80分保持稳定,可作为该模型在侧榜能力上的参考锚点。

本次评测显示GPT-6 Sol在代码执行与材料约束两个核心维度出现明显分化。代码执行满分表现可能源于本次题目难度适配,而材料约束55.00分则暴露输出一致性不足。主榜微降1.2分掩盖了内部维度剧烈波动,对选型决策构成误导。

企业用户在选择GPT-6 Sol时,需区分使用场景:代码生成类任务可继续依赖,材料引用类任务则需设置二次审核流程。任务表达77.50分回落进一步提示,复杂多步指令场景下模型稳定性不足。

从数据看,题目抽签波动是更可能解释。10题快测样本量有限,单维度2题即可造成30分以上 swings。模型真实退化需更多连续数据支持,目前仅单日结果不足以得出退化结论。

下期评测若材料约束回升至80分以上,则本次55.00分可视为随机事件;若持续低于65分,则需启动模型能力退化验证流程。工程判断维持94.80分不变,为侧榜能力提供参照。


数据来源:赢政指数 (YZ Index) | Run #364 | 查看原始数据