Gemini 2.5 Pro代码执行单日跌24.6分 主榜下滑6.5分

Gemini 2.5 Pro在今日Smoke评测中,代码执行得分从74.60分降至50.00分,降幅24.6分,主榜整体从76.49分下滑至69.98分。

得分变化细节

材料约束得分从78.80分升至94.40分,增幅15.6分。工程判断从75.00分升至88.90分,增幅13.9分。任务表达从51.70分微降至50.00分。诚信评级维持pass。

波动成因分析

Smoke评测每日仅2题/维度,样本量极小。代码执行维度2题中若出现1题完全失分,即可导致约25分级别的单日波动。今日50.00分恰好对应2题均未达标的最低区间,符合随机抽签导致的极端结果。

材料约束同时提升15.6分,显示模型在另2题材料忠实度任务中表现更优。两个维度反向变化,指向题目内容差异而非模型参数级退化。工程判断同步上升13.9分,进一步支持抽签波动解释。

对使用者的含义

重度依赖代码执行的团队,今日需对Gemini 2.5 Pro生成结果增加人工校验环节,尤其涉及多步推理或API调用的场景。材料约束得分94.40分,表明在需要严格遵循输入文档的任务中,该模型仍保持较高可用性。

开发者在选型时,应将代码执行50.00分视为单日极端值,而非新基准。连续多日观察同一维度得分标准差,才能判断真实稳定性。

战略判断

基于现有对比数据,Gemini 2.5 Pro代码执行能力更可能因题目抽签出现暂时性低谷,而非模型真实退化。主榜69.98分已低于昨日,但材料约束与工程判断的同步提升,显示整体能力分布仍处于正常区间。

下一期评测需重点验证代码执行是否回升至70分以上。若连续两日维持50分附近,则需进一步排查是否出现系统性问题。目前信号仅提示关注,不构成下调长期评估的依据。


数据来源:赢政指数 (YZ Index) | Run #238 | 查看原始数据