Qwen3 Max主榜暴跌14.9分 代码执行从96.9骤降至65.6

Qwen3 Max在今日Smoke评测中主榜得分从昨日的82.23分跌至67.31分,降幅14.9分,代码执行维度从96.90分跌至65.60分。

得分变化拆解

代码执行维度单日下降31.3分,材料约束维度从64.30分升至69.40分,工程判断(侧榜,AI辅助评估)从36.30分降至11.30分,任务表达(侧榜,AI辅助评估)从46.70分升至48.90分,诚信评级由pass转为warn。

可能成因分析

Smoke评测每日仅10题,2题/维度,单日抽签波动本属正常范围。但代码执行维度31.3分的降幅远超典型波动区间,工程判断(侧榜,AI辅助评估)同时出现25分下滑,表明模型在需要多步推理与代码生成的题目上出现系统性失误。材料约束维度反而上升5.1分,说明模型在引用给定材料时仍保持基本忠实度,问题集中于代码生成与逻辑链条的稳定性。

诚信评级从pass转为warn,进一步指向模型在部分题目中出现事实性偏差或指令偏离,这与代码执行维度的剧烈下滑形成呼应。现有数据无法区分是题目抽签恰好命中模型弱点,还是模型真实能力出现退化,但31.3分的单维度跌幅已超出正常抽签解释范围。

对使用者的含义

重度依赖代码生成的开发者团队需立即降低对Qwen3 Max的信任度。代码执行维度从96.90分跌至65.60分,意味着原本可直接使用的代码输出现在有较高概率出现逻辑错误或运行失败,需要额外人工review。

对材料忠实度要求较高的RAG场景影响较小,因为材料约束维度仍维持在69.40分,模型在引用给定文本时表现相对稳定。需要同时使用代码执行与工程判断的复杂任务场景,风险最高。

战略判断

本次14.9分主榜下滑与代码执行、工程判断两个维度的同步大跌直接相关,材料约束与任务表达的微小变化无法抵消核心能力损失。Qwen3 Max在Smoke评测中的一致性已出现明显问题,建议在下期评测中重点追踪代码执行维度是否回升。若该维度持续低于80分,则需考虑将其从代码生成类任务的主力模型名单中移除。

现有数据支持的结论是:Qwen3 Max今日表现已触发关注阈值,代码执行能力的异常下滑与诚信评级变化共同构成明确风险信号。


数据来源:赢政指数 (YZ Index) | Run #238 | 查看原始数据