Gemini 3.1 Pro材料约束暴跌17.8分 主榜下滑6分

Gemini 3.1 Pro在今日Smoke评测中材料约束得分从90.40分降至72.60分,降幅达到17.8分,主榜整体从81.93分下滑至75.90分。

各维度得分变化

代码执行从75.00分升至78.60分,上升3.6分。工程判断从88.90分升至100.00分,上升11.1分。任务表达从100.00分降至75.00分,下降25分。诚信评级维持pass。

材料约束降幅分析

材料约束维度本次下降17.8分,是主榜下滑的主要来源。Smoke评测每日仅2题抽取该维度,单题得分波动会直接放大到维度总分。17.8分的降幅在2题测试中对应单题平均失分显著增加。

代码执行同期上升3.6分,说明模型在执行类题目上的表现未出现系统性退化。工程判断升至满分100.00分,进一步显示模型在侧榜判断类任务上仍保持高水准。

任务表达同步下滑

任务表达维度下降25分,与材料约束同属较大波动。两项侧榜维度同时出现明显回落,提示本次抽签题目可能集中于需要严格遵循材料或精确表达的任务类型。

波动成因判断

Smoke评测每日仅10题,2题/维度,抽签随机性导致单日分数标准差较大。材料约束17.8分降幅与任务表达25分降幅,均可能源于本次抽中题目对材料忠实度或表达精确度要求更高,而非模型能力永久退化。

若为真实退化,通常会伴随代码执行维度同步回落,但本次代码执行反而上升3.6分,因此更可能归因于题目抽签波动。

对使用者的含义

重度依赖材料约束场景的企业,如合同审查、知识库问答、长文档摘要,应在下一次Smoke评测结果出来前暂缓将Gemini 3.1 Pro作为首选模型。

代码执行任务为主的开发者团队可继续使用,因为该维度得分不降反升,显示执行能力稳定。

战略判断

本次主榜下滑6分主要由材料约束单维度驱动,结合代码执行与工程判断均未恶化,Gemini 3.1 Pro整体能力未被系统性高估或低估。下一期Smoke评测若材料约束回升至85分以上,则可确认本次为抽签波动;若继续低于75分,则需启动多日连续跟踪。

工程判断升至100分与任务表达降至75分形成对比,说明侧榜维度间相关性较低,选型时需单独评估各侧榜得分。


数据来源:赢政指数 (YZ Index) | Run #240 | 查看原始数据