GPT-6 Luna材料约束跌20分代码执行涨41.7分 主榜升13.9分

在今日Smoke评测中,GPT-6 Luna的材料约束得分从95.00分跌至75.00分,代码执行得分从58.30分升至100.00分,主榜得分从74.82分升至88.75分。

数据事实拆解

对比昨日与今日得分,代码执行维度上升41.7分,材料约束维度下降20分,工程判断维度维持100.00分不变,任务表达维度上升10分至87.50分。主榜由代码执行与材料约束两个可审计维度加权构成,最终结果为净增长13.9分。诚信评级维持pass,未触发门槛。

Smoke评测每日仅2题/维度,共10题。材料约束单日下降20分,意味着至少一道题目在材料忠实度上出现明显扣分;代码执行单日上升41.7分,意味着对应题目在执行正确性上获得满分或接近满分。

成因分析:抽签波动还是模型退化

材料约束与代码执行同时出现大幅反向变动,最可能的原因是题目抽签波动。每日2题的样本量极小,一道涉及复杂引用的材料约束题目即可拉低20分,而一道需要精确代码输出的题目即可推高41.7分。工程判断与任务表达维度未出现同步下跌,进一步支持波动而非系统性退化的判断。

若为模型真实退化,通常会在多个维度同时显现一致性下降,但今日数据中工程判断保持满分,任务表达反而上升,诚信评级也维持pass。因此,材料约束的20分跌幅更接近单日抽签带来的统计噪声。

对使用者的具体含义

重代码执行的团队在今日可获得更高置信度,GPT-6 Luna在对应题目上达到100.00分;对材料忠实度敏感的场景则需额外人工校验,因为75.00分已低于昨日95.00分。依赖该模型的开发者应在选型时参考多日平均分,而非单日结果。

工程判断维度稳定在100.00分,说明侧榜能力未受影响;任务表达维度小幅上升,表明输出结构化能力有所改善。整体而言,单日数据对生产环境选型的影响有限。

战略判断

基于现有得分对比,GPT-6 Luna在本次Smoke评测中未显示系统性退化信号,材料约束的下降更可能是抽签波动所致。主榜得分反而上升13.9分,说明代码执行的增益覆盖了材料约束的损失。

稳定性维度此前已显示31.7分,印证该模型在同类题目上分数波动较大。建议下期继续追踪材料约束与代码执行的日间标准差,若连续两日材料约束保持低位,再评估是否需要调整权重或增加人工校验环节。

当前数据不支持“模型退化”的结论,单日10题快测的固有方差已能充分解释全部变化。


数据来源:赢政指数 (YZ Index) | Run #370 | 查看原始数据