Claude Opus 4.7代码执行从97直降50 主榜暴跌18.7分

Claude Opus 4.7在今日Smoke评测中,主榜得分从昨日82.29分降至63.59分,降幅18.7分。

数据事实拆解

得分对比显示,代码执行从97.00分跌至50.00分,降幅47分;材料约束从64.30分升至80.20分,增幅15.9分。工程判断从100.00分降至94.50分,任务表达从91.70分降至85.80分。主榜仅由代码执行与材料约束加权构成,代码执行47分跌幅直接拉低整体18.7分。

Smoke评测每日仅2题/维度,单题失误即可造成维度分数剧烈波动。代码执行维度今日得分50.00分,意味着该维度2题中至少1题未达及格标准。

成因分析

代码执行维度出现47分跌幅,最可能源于今日抽签题目难度或模型对特定代码约束的响应失败。材料约束同期提升15.9分,显示模型在忠实引用材料方面的表现并未同步退化。工程判断与任务表达小幅回落5.5分与5.9分,幅度远小于代码执行,说明退化集中于代码生成环节。

若为真实能力退化,材料约束不应出现15.9分反向提升。当前数据更支持题目抽签波动解释:每日仅2题的抽样方差较大,一次性失误即可造成维度分数腰斩。

对使用者的含义

重度依赖代码执行的开发团队需注意,Claude Opus 4.7今日代码执行50.00分表现,意味着在需要精确生成或调试代码的场景中,单次调用失败概率上升。材料约束80.20分则表明,依赖模型忠实处理给定文档或规范的场景仍可保持较高可信度。

企业选型时,若工作负载中代码执行占比超过60%,今日数据提示需增加人工复核环节或并行调用其他模型以对冲单日波动。

战略判断

代码执行维度从97.00分到50.00分的落差,在仅有2题抽样的条件下,属于高概率的随机波动,而非模型能力永久性退化。诚信评级维持pass,未出现新风险信号。

下一期评测需重点验证代码执行维度是否回升至90分以上。若连续两日维持50分附近,则需考虑模型真实退化可能。目前单日数据不足以判定模型被高估或低估,建议持续追踪3日内代码执行平均分。


数据来源:赢政指数 (YZ Index) | Run #320 | 查看原始数据