Claude Opus 4.7 趋势上升10.1分,Gemini 3.1 Pro 下降11.2分:2026-W35 Smoke周趋势

在2026-08-24至2026-08-30的Smoke评测中,Claude Opus 4.7从首日82.98分升至末日93.08分,趋势上升10.1分。

上升模型数据与机制

Claude Opus 4.7本周趋势+10.1,末日93.08分,均值86.5分,波动27.5分。Claude Sonnet 4.6趋势+12.1,从58.23分升至70.33分,均值79分,波动32.6分。DeepSeek V4 Pro趋势+7.6,从80.46分升至88.08分,均值70.7分,波动39.1分。Qwen3 Max趋势+8.3,从71.73分升至80.07分,均值80.6分,波动21.8分。Grok 4趋势+1.1,从87.09分升至88.14分,均值90分,波动13.6分。

这些上升主要与连续多天代码执行维度得分提升相关。Claude Opus 4.7在材料约束维度保持稳定,执行维度逐步收窄与标准答案偏差,导致末日得分拉升。Grok 4波动仅13.6分,显示执行与约束两个主榜维度输出一致性较高。

下降模型数据与机制

Gemini 3.1 Pro趋势-11.2,从首日96.98分跌至末日85.83分,均值83.7分,波动33.4分。Gemini 2.5 Pro趋势-6.4,从92.16分跌至85.73分,均值88.2分,波动21.1分。GPT-o3趋势-13.7,从83.23分跌至69.56分,均值87.1分,波动30.4分。GPT-5.5趋势-1.6,从64.66分跌至63.08分,均值76.8分,波动33.5分。

Gemini 3.1 Pro与GPT-o3下降伴随执行维度得分波动放大。Gemini 3.1 Pro首日高分后连续出现材料约束扣分,末日得分直接拉低11.2分。GPT-o3均值87.1分但末日仅69.56分,说明其在连续测试中工程判断侧榜得分不稳定。

持平模型与高波动信号

GLM-4.6趋势+1,从87.54分至88.58分,均值71.3分,波动43.6分。豆包 Pro趋势-0.7,从86.54分至85.89分,均值87.1分,波动9.7分。

GLM-4.6波动43.6分在所有模型中最高,执行维度与材料约束维度得分标准差大,导致稳定性低。豆包 Pro波动仅9.7分,输出一致性最优。

诚信评级变化分析

GLM-4.6与豆包 Pro首日诚信评级为warn,后六天转为pass。Grok 4第五天出现一次warn,其余为pass。诚信评级从warn转为pass的模型,本周材料约束维度扣分明显减少,说明模型输出更少出现事实性偏差。

对使用者的具体含义

重代码执行的团队可优先选择Grok 4,其均值90分且波动13.6分,适合需要稳定输出的场景。对材料忠实度敏感的场景,豆包 Pro波动9.7分且诚信评级转为pass,适合长文本生成任务。Claude Opus 4.7末日93.08分,适合需要高工程判断侧榜得分的原型开发。

依赖Gemini 3.1 Pro的开发者需注意其趋势-11.2分,连续测试中执行维度波动可能导致部署后一致性下降。GPT-o3均值87.1分但末日69.56分,对稳定性要求高的生产环境需额外验证。

战略判断

基于本周数据,Claude Opus 4.7与Claude Sonnet 4.6趋势上升明显,均值与末日得分同步提升,值得下期继续观察主榜维度表现。Gemini 3.1 Pro与GPT-o3趋势下降且波动超过30分,信号显示其在Smoke快测中一致性降低。GLM-4.6高波动43.6分与诚信评级改善并存,需验证其执行维度是否已进入稳定区间。Grok 4均值90分且波动最低,当前数据支持其在主榜两维度上被低估。


数据来源:赢政指数 (YZ Index) | Run #300 | 查看原始数据