2026-07-13 至 2026-07-19 七天 Smoke 评测显示,Claude Opus 4.7 以 86.9 分均值位居首位,GPT-o3 则从首日 97.36 分跌至末日 66.86 分,趋势下降 30.5 分。
上升模型:Claude 系列与 Qwen3 Max
Claude Opus 4.7 首日 82.95 分、末日 95.19 分,趋势上升 12.2 分,波动 20.9,是本周唯一波动低于 25 的上升模型。Claude Sonnet 4.6 从 79.6 分升至 90.02 分,趋势上升 10.4 分,均值 73.1 分。Qwen3 Max 从 72 分升至 82.23 分,趋势上升 10.2 分,波动 19.8,为波动最小模型。
上述三款模型在代码执行与材料约束两个主榜维度上保持相对稳定。Claude Opus 4.7 连续七天未出现诚信 warn,执行维度得分波动幅度最小,说明其对 Smoke 每日 10 题的回答一致性最高。
下降模型:GPT-o3 与豆包 Pro 跌幅最大
GPT-o3 首日 97.36 分、末日 66.86 分,趋势下降 30.5 分,均值 71.1 分,波动 97.4,是所有模型中波动最大的一款。豆包 Pro 从 96.7 分跌至 49.21 分,趋势下降 47.5 分,均值 72.9 分,波动 50.1。Gemini 3.1 Pro 下降 40.3 分,Gemini 2.5 Pro 下降 23.5 分。
这些模型的下降主要集中在代码执行维度。GPT-o3 在第 4 天与第 6 天出现明显低分,直接拉低周均值。豆包 Pro 在材料约束维度多次失分,导致末日得分低于 50。
波动分析:GPT-5.5 与 GLM-4.6 一致性最差
GPT-5.5 波动 100 分,首日 81.96 分、末日 81.44 分,表面持平但每日得分标准差最大。GLM-4.6 波动 53.2 分,从 66.78 分跌至 31.44 分,均值仅 58.2 分。DeepSeek V4 Pro 波动 32.7 分,下降 17.1 分。
高波动意味着模型对同类题目的回答差异大。GPT-5.5 在执行维度上某日得分可达 95,次日可能跌至 40,这种不一致对需要稳定输出的场景构成风险。
诚信评级单独观察
本周出现 warn 的模型包括 GPT-o3、Grok 4、豆包 Pro、GPT-5.5、Claude Sonnet 4.6、GLM-4.6。Grok 4 与 GLM-4.6 各出现两次 warn,GLM-4.6 末日仍为 warn。Claude Opus 4.7 与 Qwen3 Max 全周 pass,无 warn 记录。
诚信评级 warn 通常与回答中出现幻觉或偏离材料约束有关。出现 warn 的模型在 Smoke 评测中更易在材料约束维度丢分。
对使用者的具体含义
重代码执行的团队应优先考虑 Claude Opus 4.7,其 86.9 分均值与 20.9 波动可提供较高一致性。依赖材料忠实度的场景需避开 GPT-o3 与豆包 Pro,两者末日得分已低于 70。
对稳定性要求高的生产环境,Qwen3 Max 的 19.8 波动与全 pass 诚信记录是当前最优选择。GLM-4.6 均值 58.2 分且多次 warn,不适合需要连续稳定输出的任务。
战略判断
Claude Opus 4.7 本周数据最优,均值最高且波动最小,适合作为基准模型。GPT-o3 与豆包 Pro 下降幅度超过 30 分,需在下期 Smoke 数据中验证是否为偶然波动还是持续下滑。
GPT-5.5 虽然均值 72 分,但波动 100 分,实际可用性低于均值显示水平。Qwen3 Max 上升 10.2 分且波动最小,值得持续跟踪其执行维度得分变化。
数据来源:赢政指数 (YZ Index) | Run #237 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接