2026-07-28至2026-08-02期间,Qwen3 Max在Smoke评测中从首日59.28分升至末日96.1分,趋势值达到+36.8,成为七天内上升幅度最大的模型。
上升模型的得分轨迹与机制
豆包Pro从92.07分升至96.7分,趋势+4.6,均值84.9,波动21.7。Grok 4从84.47分升至96.1分,趋势+11.6,均值82.5,波动26.5。DeepSeek V4 Pro从84分升至94.45分,趋势+10.5,均值87.8,波动20.1。Claude Sonnet 4.6从79.91分升至94.45分,趋势+14.5,均值75.5,波动39.4。Gemini 2.5 Pro从77.6分升至96.1分,趋势+18.5,均值70.6,波动37.2。Claude Opus 4.7从56.5分升至94.45分,趋势+38,均值83.4,波动38。
这些上升主要集中在执行与材料约束两个主榜维度。DeepSeek V4 Pro均值87.8在上升模型中最高,显示其代码执行与材料约束的日间一致性相对更好。Qwen3 Max与Claude Opus 4.7的末日得分均达到96.1分与94.45分,说明它们在连续七天内逐步缩小与顶尖模型的差距。
下降模型的得分轨迹与机制
Gemini 3.1 Pro从首日100分降至末日94.45分,趋势-5.6,均值83.9,波动27.3。GPT-o3从97.75分降至96.1分,趋势-1.7,均值87.6,波动18.5。GLM-4.6从77.6分降至74分,趋势-3.6,均值59.7,波动38。
Gemini 3.1 Pro首日满分后持续回落,说明其在材料约束维度出现多次扣分。GPT-o3均值87.6仍高于多数上升模型,但趋势为负,显示其执行维度稳定性不足以抵消小幅下滑。GLM-4.6均值仅59.7,是所有模型中最低,结合其诚信评级多次出现warn,表明材料约束与诚信维度同时拉低整体得分。
高波动模型的成因分析
Claude Sonnet 4.6波动39.4,Gemini 2.5 Pro波动37.2,Claude Opus 4.7波动38,Qwen3 Max波动36.8,GLM-4.6波动38。这些模型的稳定性得分均低于35分,意味着同类题目多次作答时分数标准差较大。
高波动最可能源于执行维度在不同题目上的表现不一致。Claude系列模型在首日得分偏低,后期出现大幅回升,说明其对材料约束的响应在不同日期存在明显差异。Qwen3 Max与Gemini 2.5 Pro同样呈现前期低、后期高的模式,波动值接近37分,反映出代码执行环节的随机性较强。
诚信评级变化的单独信号
DeepSeek V4 Pro诚信评级出现pass→warn→pass→pass→pass→warn的波动。GLM-4.6同样出现pass→warn→pass→pass→warn的记录。诚信评级为准入门槛,warn状态直接影响模型在工程判断与任务表达侧榜的可用性。
DeepSeek V4 Pro均值87.8在所有模型中排名靠前,但诚信评级反复warn,说明其在材料约束环节偶发不一致行为。GLM-4.6均值59.7且诚信评级多次warn,表明其在主榜两个维度均存在系统性问题。
对使用者的具体含义
重代码执行的团队应优先考虑DeepSeek V4 Pro,其均值87.8且趋势+10.5,执行维度表现相对稳定。对材料忠实度敏感的场景需避开GLM-4.6,其均值59.7且诚信评级多次warn,风险较高。
依赖连续多天稳定输出的开发者应关注GPT-o3,其波动18.5为所有模型最低,适合对一致性要求高的生产环境。Claude Opus 4.7与Qwen3 Max末日得分已接近96分,但波动超过36分,适合在非关键任务中试用。
战略判断
Gemini 3.1 Pro均值83.9仍高于多数上升模型,但趋势-5.6,显示其领先地位正在被逐步追赶。Qwen3 Max与Claude Opus 4.7的趋势值分别达到+36.8与+38,表明低基数模型在执行与材料约束两个维度存在明显追赶空间。
GLM-4.6均值59.7且诚信评级多次warn,属于被低估风险较高的模型。GPT-5.5持平趋势0.8,均值82.3,波动28.5,处于中间位置,适合作为基准参照。
本周数据仅支持以上基于2026-07-28至2026-08-02七天得分的判断。下一期需验证DeepSeek V4 Pro诚信评级是否持续稳定,以及Qwen3 Max与Claude Opus 4.7的高趋势是否延续。
数据来源:赢政指数 (YZ Index) | Run #257 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接