Claude Sonnet 4.6材料约束暴跌20.5分 代码执行却冲到100

Claude Sonnet 4.6在今日Smoke评测中,材料约束得分从昨日100.00降至79.50,单日下跌20.5分,同时代码执行从73.70升至100.00,主榜整体从85.54升至90.78。

得分事实与主榜构成

主榜仅由代码执行与材料约束两个维度加权构成。今日代码执行满分100.00,材料约束79.50,两者平均后主榜达到90.78。昨日材料约束满分时主榜为85.54,今日材料约束损失20.5分却被代码执行26.3分增幅抵消,主榜仍实现+5.2。

工程判断从100.00降至60.50,任务表达从95.80降至95.00,均属侧榜(AI辅助评估),不计入主榜排名。诚信评级维持pass。

可能成因分析

Smoke评测每日仅10题,每维度2题,题目抽签随机性高。材料约束单日损失20.5分,最可能源于今日抽到的2道材料约束题目对模型输出忠实度要求更高,模型在引用或约束遵循上出现扣分。代码执行2题全部满分,显示模型在该维度抽签题目上表现稳定。

若为模型真实退化,通常多个维度会同步出现波动,而今日任务表达仅降0.8分,侧榜工程判断虽降39.5分但不影响主榜。单一维度大幅波动且另一核心维度反向满分,更符合抽样波动特征,而非系统性能力下降。

对使用者的具体含义

对重度依赖材料约束的场景,例如长文档摘要、合同条款提取、知识库问答,Claude Sonnet 4.6今日79.50分意味着输出可能出现事实偏离或遗漏,建议增加人工校验环节。

对代码执行需求为主的开发者团队,今日100.00分显示该模型在算法实现、调试脚本等任务上具备高可靠性,可继续用于生产环境。

同时使用两类任务的混合团队需注意,模型在同一批次回答中可能出现维度间表现不均,建议按任务类型分别设置提示词或后处理规则。

战略判断

基于今日数据,Claude Sonnet 4.6材料约束的20.5分跌幅最可能由题目抽签波动导致,而非模型真实退化。主榜因代码执行满分仍实现净增长,表明核心能力未出现系统性问题。

单日Smoke评测波动属于正常范围,建议下一期继续追踪材料约束得分是否回升。若连续两日材料约束保持在80分以下,再考虑是否触发更深层评测。当前数据不支持对模型整体能力下调结论。

工程判断侧榜(AI辅助评估)的大幅下降可作为次要观察指标,但不改变主榜判断。诚信评级维持pass,模型回答一致性未触发诚信门槛。


数据来源:赢政指数 (YZ Index) | Run #297 | 查看原始数据