Claude Opus 4.7在今日Smoke评测中代码执行得分从100.00分降至69.50分,材料约束得分从71.90分升至95.00分,主榜得分从87.36分降至80.98分。
得分变化事实
代码执行维度出现-30.5分变化,材料约束维度出现+23.1分变化,工程判断维度出现+25分变化,任务表达维度出现+5分变化。主榜整体下降6.4分。诚信评级保持pass。
波动成因分析
Smoke评测每日仅10题,每维度2题。代码执行维度单题失误即可导致30分以上下滑。材料约束与工程判断同时大幅上升,说明模型整体输出能力未出现系统性退化。题目抽签随机性是本次变化的最可能机制。
代码执行69.50分 vs 昨日100.00分,材料约束95.00分 vs 昨日71.90分,两维度反向运动指向抽签而非模型退化。
对使用者的具体含义
重度依赖代码执行的开发者团队需在连续多日Smoke数据稳定后再决定是否调整工作流。材料约束得分提升,对需要严格遵循提示词或格式的场景构成正面信号。工程判断升至100.00分,侧榜(AI辅助评估)显示模型在工程决策类问题上表现更一致。
战略判断
本次代码执行暴跌最可能由单日题目抽签造成,而非模型真实能力退化。主榜仅下降6.4分的事实进一步支持这一判断。建议下一期Smoke评测继续跟踪代码执行维度,若连续两日低于80分再启动深度复测。当前数据不支持对Claude Opus 4.7进行选型下调。
工程判断从75.00分升至100.00分,任务表达从90.00分升至95.00分,两个侧榜(AI辅助评估)维度同步改善,印证模型在非代码执行任务上的稳定性未受影响。
对于正在进行模型选型的团队,Claude Opus 4.7今日数据仅显示单维度抽签波动,不构成放弃该模型的充分理由。材料约束95.00分与工程判断100.00分的数据,适合对格式忠实度和工程决策有较高要求的场景。
稳定性维度衡量的是模型多次回答同类题目的分数标准差,本次单日30.5分变化属于小样本抽签正常范围。主榜80.98分仍处于可用区间。
综合全部维度数据,Claude Opus 4.7在今日Smoke评测中的异常主要集中在代码执行一题,材料约束与工程判断的显著提升抵消了大部分负面影响。使用者可继续按原计划使用该模型,同时关注后续两日代码执行得分是否回升至90分以上。
数据来源:赢政指数 (YZ Index) | Run #266 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接