Claude Sonnet 4.6在今日Smoke评测中,代码执行维度得分从昨日71.90分跌至44.50分,降幅27.4分;材料约束维度从50.60分升至88.30分,增幅37.7分;主榜得分从62.32分升至64.21分,仅增加1.9分。
得分对比数据
工程判断(侧榜,AI辅助评估)从75.00分升至100.00分,任务表达(侧榜,AI辅助评估)从83.90分跌至45.00分。诚信评级维持pass。Smoke评测每日仅10题,每维度2题,单日得分波动属于正常范围,但本次代码执行与材料约束的相反方向剧烈变化,幅度超过以往单日记录。
成因分析
代码执行维度仅2题,昨日可能抽中需要多步调试或复杂逻辑的题目,今日抽中简单计算或已知模式题目,导致得分直接回落27.4分。材料约束维度昨日可能遇到需要严格忠实原文的约束任务,今日抽中宽松材料,模型输出更易通过评分。任务表达维度同样受2题限制,昨日高分可能来自结构清晰的输出,今日低分可能来自抽中需要精确格式的任务。主榜得分由代码执行与材料约束加权平均得出,两维度一跌一涨后净值仅+1.9分,说明主榜对极端波动有一定缓冲。
对使用者的含义
重代码执行的团队在依赖Claude Sonnet 4.6处理算法或数据处理任务时,需增加人工复核环节,因为单日44.50分水平可能在真实场景中出现更多执行错误。对材料忠实度敏感的场景,如合同审查或技术文档生成,今日88.30分表现显示模型在约束遵循上具备潜力,可在该类任务中优先测试。工程判断升至满分,意味着侧榜评估下模型在工程决策类问题上输出更可靠,但任务表达45分提示在需要清晰表达的场景中可能出现格式或逻辑跳跃。
战略判断
本次变化最可能由题目抽签波动导致,而非模型真实退化。Smoke评测样本量过小,单维度仅2题,任何一题难度或约束强度的微小差异都会放大得分差距。主榜得分仍维持在64分区间,说明整体能力未出现系统性下滑。建议下期评测重点观察代码执行维度是否回升至60分以上,以及材料约束是否回落至70分以下。若两维度同时维持当前极端水平,则需进一步验证模型在对应任务上的稳定性。
对于正在选型的企业,Claude Sonnet 4.6在材料约束维度的单日高分可作为参考,但代码执行的低分提示不宜作为核心代码生成工具直接部署。开发者若依赖该模型进行多轮调试任务,应准备备用模型或人工校验流程,以应对可能的得分波动。
数据来源:赢政指数 (YZ Index) | Run #361 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接