2026-08-06至2026-08-09期间,Claude Sonnet 4.6首日得分92.17、末日69.56,趋势-22.6,均值79.6,波动22.6。
下降模型的得分轨迹与机制
Claude Sonnet 4.6在四天内出现最大单模型跌幅,首末日差值22.6分直接拉低其均值至79.6。DeepSeek V4 Pro同样呈现下降,首日92.17、末日86.5,趋势-5.7,均值83.5,波动32.9。Gemini 2.5 Pro从71.3降至63.95,趋势-7.3,均值76.4,波动23.3。GLM-4.6跌幅达22.1分,首日59.86、末日37.76,均值仅24.4,波动59.9,诚信评级从pass转为缺失记录。
这些下降主要集中在执行与材料约束主榜维度。Claude Sonnet 4.6与GLM-4.6的连续低分日,显示其在连续快测中的一致性不足。GLM-4.6波动59.9意味着其单日得分标准差极高,多次回答同类题目时分数起伏大,而非单纯正确率问题。
上升模型的得分轨迹与机制
GPT-o3从89.2升至95.91,趋势+6.7,均值88.8,波动25.3。Claude Opus 4.7从87.36升至92.85,趋势+5.5,均值89.7,波动16.7。Gemini 3.1 Pro涨幅最大,从73.61升至84.66,趋势+11.1,均值80.5,波动28.7。Qwen3 Max从80.48升至85.82,趋势+5.3,均值81.9,波动30.8。Grok 4从82.99升至84.27,趋势+1.3,均值85.9,波动14.1。
GPT-o3与Claude Opus 4.7的上升伴随较低波动,表明其在代码执行与材料约束两项主榜维度上保持了相对稳定的输出质量。Gemini 3.1 Pro虽然涨幅最高,但波动28.7仍高于Grok 4的14.1,说明其得分提升过程中一致性尚未完全巩固。
诚信评级变化的独立信号
GPT-o3诚信评级从pass转为warn,Grok 4从pass转为warn再回pass,GLM-4.6诚信评级记录出现缺失。诚信评级是准入门槛而非加分项,warn状态直接影响模型在生产环境中的可部署性。GPT-o3尽管均值88.8位居前列,其诚信评级波动已构成使用门槛。
高波动模型的使用者含义
GLM-4.6波动59.9、DeepSeek V4 Pro波动32.9、Qwen3 Max波动30.8的模型,适合对一致性要求较低的探索性任务。重代码执行的团队若选用GLM-4.6,需额外投入人工校验环节以应对其单日得分剧烈变化。对材料忠实度敏感的场景则应优先选择波动14.1的Grok 4或波动16.7的Claude Opus 4.7。
稳步上升模型的战略判断
GPT-o3与Claude Opus 4.7在四天内均保持正趋势且均值超过88分,数据支持将其列为当前Smoke快测中的稳定上升组。Gemini 3.1 Pro涨幅11.1分但波动28.7,需下期继续验证其一致性是否收敛。豆包 Pro连续四天均值0,表明其在本次Smoke评测中未产生有效得分记录。
基于现有首末日对比,Claude Sonnet 4.6与GLM-4.6的下滑幅度已超过多数上升模型的涨幅,数据指向这两者在本周Smoke快测中被相对低估的概率较低。GPT-o3的+6.7趋势与均值88.8的组合,是本期唯一同时满足上升与较高均值的模型。
数据来源:赢政指数 (YZ Index) | Run #270 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接