Qwen3 Max主榜单日暴跌10.2分,材料约束暴跌21.5分成主因

Qwen3 Max在今日Smoke评测中主榜得分从96.04分跌至85.82分,降幅达到10.2分。

得分拆解:材料约束单维度主导跌幅

代码执行维度从100.00分降至99.00分,仅下降1分。材料约束维度从91.20分降至69.70分,下降21.5分。工程判断从55.60分降至50.00分,下降5.6分。任务表达从41.70分升至73.90分,上升32.2分。主榜仅由代码执行与材料约束加权构成,因此材料约束的21.5分跌幅直接拉低整体10.2分。

成因分析:题目抽签还是真实退化

Smoke评测每日仅10题,2题/维度,单日波动属正常范围。材料约束维度本次跌幅远超代码执行,说明当日抽中的材料约束题目可能包含更高难度的忠实度要求或冲突指令。代码执行仍维持99.00分,表明模型基础计算能力未出现系统性下降。任务表达侧榜大幅上升32.2分,进一步显示模型在表达类题目上未受影响,指向问题集中在材料约束这一特定维度。

材料约束维度本次跌幅21.5分,远高于代码执行的1分,说明波动主要来自材料约束题目抽签。

对使用者的含义

重代码执行的团队可继续使用Qwen3 Max,代码执行维度仍保持99.00分,影响有限。对材料忠实度敏感的场景,例如合同抽取、政策比对、长文档摘要,Qwen3 Max今日69.70分表现需要额外人工校验。工程判断侧榜降至50.00分,对需要工程决策辅助的开发者影响较小,因该维度本身权重较低。

战略判断

本次跌幅主要由材料约束单维度驱动,且代码执行仍接近满分,属于典型抽签波动而非模型整体退化。诚信评级维持pass,未出现诚信问题。建议下一期Smoke评测重点观察材料约束是否回升至90分以上,若连续两期低于80分,则需进一步验证模型在约束类任务上的一致性。

当前数据不支持将本次波动解读为模型能力永久下降。Qwen3 Max在代码执行维度仍维持高位,适合以代码为主的工作流;材料约束场景则需增加验证步骤。


数据来源:赢政指数 (YZ Index) | Run #270 | 查看原始数据