DeepSeek V4 Pro代码执行暴跌25分 主榜下滑6.7分

DeepSeek V4 Pro在今日Smoke评测中,代码执行得分从昨日100.00降至75.00,主榜得分从83.53降至76.85。

得分事实与维度拆解

主榜仅由代码执行与材料约束加权构成。今日代码执行75.00、材料约束79.10,两者平均后得出主榜76.85。代码执行单日下降25分,材料约束则上升15.7分。工程判断从70.80升至100.00,任务表达从91.70降至74.20,诚信评级从warn转为pass。

波动成因分析

Smoke评测每日仅10题,2题/维度,样本量小导致单日标准差天然较高。代码执行暴跌最可能源于今日抽中的2道题目对函数调用、边界条件或多步推理要求更高,而昨日题目相对宽松。材料约束上升则显示模型在今日题目中对给定材料忠实度有所改善。工程判断与任务表达同属侧榜(AI辅助评估),其剧烈变化同样受限于极小样本,无法直接推断模型能力结构性改变。

代码执行75.00 vs 昨日100.00,材料约束79.10 vs 昨日63.40,主榜76.85 vs 昨日83.53。

目前数据不支持“模型真实退化”的结论,因为材料约束与工程判断同时出现明显正向移动,说明模型整体输出质量并未系统性下降。更大可能是题目抽签带来的方差。

对使用者的具体含义

重度依赖代码执行的团队(如自动生成测试用例、数据处理脚本的开发者)需在今日后增加人工复核环节,避免因单日波动引入潜在错误。材料约束79.10分表明模型在需要严格遵循给定文档或API说明的场景中表现尚可,可继续用于文档问答类任务。诚信评级转为pass,降低了该模型在生产环境中的合规准入门槛。

战略判断

基于现有得分对比,DeepSeek V4 Pro主榜下滑主要由代码执行单维度波动驱动,并非全维度退化。下一期评测若代码执行仍维持在80分以下,则需提高关注优先级;若回升至90分以上,则可判定今日为典型抽签噪声。目前数据仅支持“继续观察”的结论,不支持下调模型优先级的判断。


数据来源:赢政指数 (YZ Index) | Run #254 | 查看原始数据