Claude Sonnet 4.6代码执行暴跌22分 主榜仅降0.5

Claude Sonnet 4.6在今日Smoke评测中,代码执行维度从昨日97.00分跌至75.00分,降幅22分;材料约束维度则从67.60分升至93.30分,增幅25.7分;主榜得分从83.77分变为83.24分,仅下降0.5分。

数据事实:小样本驱动的极端反向波动

Smoke评测每日仅10题,每维度2题。代码执行单日损失22分,意味着模型在今日2道代码执行题目上平均得分大幅低于昨日。材料约束同期获得25.7分提升,说明其在今日2道材料约束题目上表现显著优于昨日。工程判断从100.00降至94.50,任务表达从70.00升至95.00。诚信评级维持pass。

成因分析:题目抽签波动而非模型真实退化

代码执行与材料约束呈现近乎对称的反向变化,最可能原因是今日抽中的4道题目(各维度2题)与模型能力匹配度出现极端差异。Smoke评测题目每日更换,单题得分权重高,2题样本下,一道难题即可拉低维度均分22分。材料约束同时大幅上升,进一步支持“题目适配度变化”而非“模型能力下降”的解释。若模型出现系统性退化,通常不会在同一日出现另一核心维度同等幅度的提升。

工程判断小幅回落5.5分、任务表达上升25分,也符合小样本随机波动特征。主榜得分仅微降0.5分,显示代码执行与材料约束的剧烈变化被相互抵消,这与每日2题/维度的设计直接相关。

对使用者的含义

重度依赖代码执行的开发团队需注意,单日Smoke得分75.00并不代表模型真实代码能力已降至该水平。建议在选型或日常验证时采用更大样本测试,避免被单日2题结果误导。对材料约束敏感的场景(如长文档忠实度要求高的应用),今日93.30分显示模型在对应题目上仍有稳定发挥空间。

企业若将Smoke得分作为每日监控指标,应同时观察主榜整体变化,而非孤立看待单一维度。代码执行与材料约束的反向波动,提醒使用者小样本快测的固有局限。

战略判断

基于当前单日数据,Claude Sonnet 4.6代码执行维度无需立即判定为真实退化。主榜得分保持83.24分,说明整体能力未出现系统性下滑。下一期需验证代码执行是否持续低于85分,若连续两日均出现类似低分,再考虑模型能力变化的可能性。目前信号更指向题目抽签带来的正常波动。

对于依赖该模型的开发者,短期内可继续按原有策略使用,同时增加对代码执行任务的内部测试覆盖,以对冲小样本评测的随机性。


数据来源:赢政指数 (YZ Index) | Run #299 | 查看原始数据