GPT-6 Luna主榜暴跌8.4分 代码执行单日跌16.7分

在今日Smoke评测中,GPT-6 Luna主榜从83.19分跌至74.82分,下降8.4分。代码执行维度从75.00分跌至58.30分,任务表达从90.00分跌至77.50分,材料约束从93.20分升至95.00分,工程判断维持100.00分,诚信评级保持pass。

数据事实拆解

Smoke评测每日仅2题/维度,主榜仅由代码执行与材料约束加权构成。今日代码执行维度得分58.30分较昨日75.00分下降16.7分,直接拉低主榜8.4分。任务表达维度下降12.5分,但不计入主榜。材料约束维度反而上升1.8分,工程判断零波动。

成因分析:抽签波动还是真实退化

代码执行维度仅2题,单题失分即可造成16.7分级别的剧烈波动。材料约束维度同期上升,说明模型整体输出质量未出现系统性下滑。工程判断维度连续两日满分,表明模型在需要工程决策的题目上仍保持稳定输出。任务表达维度下降可能与代码执行题目本身对表达清晰度的要求重合,导致同一批题目同时影响两个维度。现有数据不支持模型真实退化结论,最可能原因是题目抽签带来的小样本方差。

代码执行58.30分 vs 材料约束95.00分,同一模型在同一日出现17.7分维度内差,指向题目难度分布而非能力断崖。

对使用者的含义

重代码执行的团队在今日看到GPT-6 Luna得分58.30分,需警惕单日抽样带来的误判。依赖材料约束的场景则可继续使用,95.00分显示该维度仍处于高位。对任务表达有严格要求的开发者,应在关键输出前增加人工校验环节,因为77.50分已低于昨日水平。

  • 代码生成场景:今日58.30分提示可能遇到高难度测试用例,建议多跑2-3次Smoke或自建基准验证。
  • 文档约束场景:95.00分可放心使用,材料忠实度未受影响。
  • 工程决策场景:100.00分保持稳定,适合需要一致判断的流程。

战略判断

基于单日数据,GPT-6 Luna主榜下滑主要由代码执行维度2题失分驱动,材料约束与工程判断维度未出现同步恶化,因此无需立即下调对其长期能力的评估。下一期Smoke评测若代码执行维度回升至70分以上,则可确认今日为抽样异常;若继续低于65分,则需进一步排查模型在代码类题目上的稳定性。

工程判断维度连续满分与诚信评级pass共同构成准入门槛信号,说明模型在核心能力之外的辅助维度仍可靠。使用者可继续观察后续3日代码执行平均分,若标准差超过15分,则需在生产环境增加多模型并行验证机制。

材料约束维度小幅上升1.8分,显示模型在约束遵循上仍有余量,可作为代码执行维度波动的缓冲。整体而言,今日数据最合理的解释是小样本抽签波动,而非模型能力退化,值得下期继续跟踪同一维度得分以确认趋势。


数据来源:赢政指数 (YZ Index) | Run #368 | 查看原始数据