Qwen3 Max在今日Smoke评测中,材料约束得分从昨日67.70分跌至47.70分,降幅达到20分,而代码执行得分从54.70分升至92.50分,升幅37.8分,主榜整体从60.55分升至72.34分。
主榜得分拆解与直接对比
主榜仅由代码执行与材料约束两个维度加权构成。今日代码执行92.50分对比昨日54.70分,材料约束47.70分对比昨日67.70分。两者加权后主榜净升11.8分。工程判断从72.20分降至55.60分,任务表达从31.70分升至66.70分,均为侧榜维度,不计入主榜。
材料约束20分跌幅的可能机制
Smoke评测每日仅2题覆盖材料约束维度。单题得分波动可直接导致维度分差达20分以上。今日材料约束47.70分对应两题平均正确率约47.7%,昨日67.70分对应约67.7%。题目抽签随机性是首要解释:若今日两题均涉及严格引用原文或多段落一致性要求,模型输出偏差即会放大扣分。代码执行同时暴涨37.8分,同样指向题目难度分布变化,而非模型整体能力突变。
代码执行92.50分与材料约束47.70分同时出现,说明模型在不同任务类型上的表现差异被当日题目放大。
对使用者的场景含义
重度依赖材料忠实度的场景,例如法律合同抽取、学术引用核对、长文档事实校验的团队,今日47.70分提示需增加人工复核环节。代码生成与调试为主的开发者则可继续使用92.50分水平下的输出,但仍需验证材料引用部分。工程判断侧榜55.60分对系统架构决策参考价值降低,任务表达66.70分对提示词迭代有一定辅助。
稳定性与真实退化区分
稳定性维度衡量多次同类题目得分标准差,今日单日数据无法计算标准差。材料约束单日-20分与代码执行+37.8分并存,更符合抽签波动特征,而非模型参数级退化。诚信评级维持pass,未出现一致性或事实捏造问题。
战略判断
基于现有得分对比,Qwen3 Max主榜上升主要由代码执行单维度拉动,材料约束的20分跌幅在2题样本下不构成持续退化信号。下一期Smoke评测若材料约束仍低于55分,则需重点验证;若回升至65分以上,则确认今日为抽签异常。当前数据不支持对模型整体能力下调结论。
企业选型时,需同时观察连续三日材料约束得分标准差。若标准差超过15分,说明该模型在材料约束维度一致性不足,适合仅作为代码辅助工具,而非核心知识工作底座。开发者可针对材料约束弱项设计二次校验流程,以降低47.70分水平下的潜在风险。
数据来源:赢政指数 (YZ Index) | Run #255 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接