Claude Sonnet 4.6材料约束暴跌33.6分 主榜下滑4.4

Claude Sonnet 4.6在今日Smoke评测中,材料约束得分从昨日的100.00分跌至66.40分,主榜整体从86.25分降至81.86分。

得分对比与核心事实

代码执行从75.00分升至94.50分,任务表达从79.70分升至90.00分,工程判断从100.00分降至82.50分。诚信评级维持pass。以上全部数据来自同一Smoke评测,昨日与今日对比仅限这两个单日结果。

材料约束暴跌的可能成因

Smoke评测每日仅10题,每维度2题。材料约束单日-33.6分,最可能源于题目抽签波动。两道新题对材料忠实度的要求更高,直接拉低该维度得分。代码执行同时+19.5分,说明模型在另一组题目上执行能力并未退化。工程判断-17.5分同样指向题目难度变化,而非模型整体能力下降。

若为模型真实退化,通常会伴随多个维度同步走低,但今日代码执行与任务表达均有明显上升,因此真实退化概率较低。

对使用者的具体含义

重度依赖材料约束的场景,例如法律合同审查、内部文档改写、长文本忠实度要求高的任务,需在下一次Smoke评测结果出来前暂缓大规模部署。代码执行得分已达94.50分,重代码执行的团队可继续使用该模型处理编程相关工作。

工程判断(侧榜,AI辅助评估)降至82.50分,对需要复杂决策链的流程可能产生影响,开发者应在关键节点增加人工复核。

战略判断

单日材料约束-33.6分不足以判定模型能力退化,但该维度波动幅度已超过主榜平均水平。下一期Smoke评测若材料约束仍低于80分,则需将该模型从材料敏感场景中降级使用。目前数据仅支持“题目抽签导致”的结论,不支持“持续退化”的判断。

建议将Claude Sonnet 4.6的材料约束得分设为每日监控项,连续两日低于75分再做选型调整。


数据来源:赢政指数 (YZ Index) | Run #315 | 查看原始数据