在今日Smoke评测中,Claude Sonnet 4.6的代码执行得分从94.50分跌至75.00分,降幅19.5分,而材料约束得分从43.30分升至97.80分,主榜总分从71.46分升至85.26分。
数据事实:单日两题抽样下的极端反差
本次评测仅包含每日10题、每维度2题的快测设置。代码执行维度单日损失19.5分,材料约束维度单日增益54.5分,两者数值差达到74分。工程判断从88.90分微降至86.70分,任务表达从90.00分降至85.80分。诚信评级维持pass。
成因分析:题目抽签波动而非模型退化
Smoke评测每日仅2题的样本量极小,单题得分权重极高。代码执行维度本次可能抽中了对该模型不利的题目类型,导致75.00分低位;材料约束维度则抽中了高度匹配的约束任务,推高至97.80分。工程判断与任务表达的降幅均在5分以内,属于正常区间波动。现有数据不支持模型真实能力退化的结论,相反,主榜总分上升13.8分显示材料约束的极端正向贡献覆盖了代码执行的损失。
对使用者的含义
重度依赖代码执行的开发团队需注意,单日75.00分表现可能出现在连续抽签不利时,建议在关键代码生成任务中增加人工复核环节。对材料忠实度敏感的场景,如合同审查或数据提取,Claude Sonnet 4.6本次97.80分表现显示其在特定约束任务上具备高可用性。工程判断与任务表达得分仍保持85分以上区间,对需要结构化输出的产品集成影响有限。
战略判断
本次数据最可能由抽签波动驱动,而非模型系统性变化。主榜总分上升的事实表明,材料约束维度的权重在当前评测中对整体排名影响更大。需要下期验证的信号是:若连续三次Smoke评测中代码执行得分均低于80分,则应启动更大数据集的专项测试。当前单日数据不足以判定Claude Sonnet 4.6被高估或低估,建议将该模型列入观察列表而非调整优先级。
综合本次得分对比,Claude Sonnet 4.6在Smoke评测中的表现符合小样本高方差特征,整体能力未出现需要立即关注的退化信号。
数据来源:赢政指数 (YZ Index) | Run #268 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接