Claude Sonnet 4.6材料约束暴跌30.6分,代码执行反升25分

Claude Sonnet 4.6在今日Smoke评测中,材料约束得分从93.30分降至62.70分,降幅达到30.6分;代码执行得分从50.00分升至75.00分,升幅25分。主榜得分从69.49分变为69.47分,变化接近零。

核心数据拆解

Smoke评测每日仅10题,2题对应一个维度。材料约束与代码执行同属主榜可审计维度。昨日材料约束93.30分对应高材料忠实度表现,今日62.70分直接拉低该维度。代码执行从50.00分跃升25分,部分抵消材料约束损失,使主榜维持69.47分。

工程判断从88.90分升至100.00分,任务表达从75.00分升至90.80分,两个侧榜维度同步上行。诚信评级连续两日保持pass,未触发门槛。

波动成因分析

材料约束单日跌幅30.6分,最可能源于题目抽签随机性。Smoke评测每日更换题目,2题样本下,单题失误即可造成20-30分级波动。代码执行同期大幅上升,表明模型在代码相关任务上未出现系统性退化。两个主榜维度反向运动,指向题目内容差异而非模型能力整体下降。

若为真实退化,代码执行与材料约束通常同向变动;本次反向变动更符合抽签波动特征。工程判断与任务表达同时提升,也支持模型基础能力未受影响。

对使用者的具体含义

重材料忠实度的场景,例如长文档摘要、合同条款提取、代码注释生成,需额外人工校验Claude Sonnet 4.6今日输出。重代码执行的团队可继续使用该模型,75.00分已高于昨日水平。

同时依赖材料约束与代码执行的混合任务,建议增加中间检查节点,避免单维度波动传导至最终结果。诚信评级pass表明模型未出现拒绝回答或明显幻觉,基础可用性仍在安全区间。

战略判断

主榜得分69.47分与昨日69.49分差异可忽略,单日材料约束暴跌未改变整体排名位置。下一期Smoke评测若材料约束回升至80分以上,则本次跌幅可判定为抽签噪声;若持续低于70分,则需关注是否进入新波动区间。

目前数据不支持模型真实退化结论,建议保持原有使用策略,仅在材料约束敏感场景增加验证步骤。


数据来源:赢政指数 (YZ Index) | Run #364 | 查看原始数据