Qwen3 Max在今日Smoke评测中代码执行得分从96.70分降至75.00分,材料约束得分从48.80分升至69.20分,主榜得分从75.15分降至72.39分。
数据事实:维度得分对比
代码执行维度出现-21.7分变化,材料约束维度出现+20.4分变化,工程判断从36.10分升至47.20分,任务表达从60.00分降至41.70分,诚信评级从pass转为warn。主榜仅下降2.8分。
成因分析:抽签波动还是真实退化
Smoke评测每日仅10题,每维度2题,样本量极小。代码执行与任务表达同时出现大幅下降,材料约束与工程判断同时上升,表明题目抽签带来的难度分布变化是主要驱动因素。主榜得分仅微降2.8分,说明两个核心维度的反向变动相互抵消,尚未形成一致性退化信号。
诚信评级转为warn是本次变化中唯一需要额外关注的点。该评级直接影响模型准入资格,其触发机制与代码执行和任务表达的低分直接相关,但目前仍处于warn而非fail区间。
对使用者的含义
重度依赖代码执行场景的团队需在今日后增加人工复核环节。代码执行75.00分已低于材料约束69.20分,意味着该模型在需要精确计算或结构化输出的任务中稳定性下降。材料约束69.20分提升则对需要严格遵循输入约束的场景形成正面影响。
工程判断47.20分与任务表达41.70分的分差显示,模型在工程决策类问题上的表现相对优于开放式表达任务。依赖任务表达的开发者应暂时降低对Qwen3 Max的预期。
战略判断
本次变化最可能由题目抽签波动导致,而非模型能力退化。主榜仅下降2.8分且两个核心维度反向变动,符合小样本快测的正常范围。诚信评级warn是唯一需要下期验证的信号,若下一期评测中代码执行与任务表达仍维持低位,则需考虑模型真实一致性问题。
当前数据不支持将Qwen3 Max判定为高估或低估,仅提示单日波动已触及诚信门槛。建议在下期Smoke评测中重点观察代码执行与诚信评级两项指标的恢复情况。
数据来源:赢政指数 (YZ Index) | Run #309 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接