Gemini 2.5 Pro 诚信评级 fail 探针 25 分,主榜 18.37 分代码执行仅 23.50

Gemini 2.5 Pro 在 2026-08-21 Run#288 的 Smoke 快测中,诚信评级直接 fail,探针得分仅 25.00,主榜得分 18.37 分,代码执行 23.50 分,材料约束 12.10 分。这一结果与同日其他模型形成明显对比。

分数结构拆解

主榜仅包含代码执行与材料约束两个维度。Gemini 2.5 Pro 两个维度均处于低位:代码执行 23.50 分,材料约束 12.10 分。材料约束得分低于代码执行,显示模型在长文档引用核验任务中问题更突出。诚信 fail 由 42 个金丝雀探针触发,探针得分 25.00,独立于上述两个维度。

同日其他模型数据为参照:DeepSeek V4 Pro 探针 90.00、Claude Opus 4.7 探针 80.00、GPT-5.5 探针 80.00、Grok 4 探针 70.00。Gemini 2.5 Pro 的 25.00 分是当日最低值。

探针触发机制分析

诚信评级 fail 意味着模型在 42 个虚构实体探针中将不存在的引用或来源当作真实内容输出。材料约束 12.10 分进一步显示,模型在给定长文档后仍难以严格基于材料作答并正确引用。两个低分同时出现,指向模型在引用生成环节的系统性问题,而非单一任务难度导致。

历史数据显示,2026-08-20 Run#286 主榜 62.42 分、诚信 pass(探针 100.00),2026-08-19 Run#284 主榜 74.18 分、诚信 pass(探针 90.00)。2026-08-21 是已公布 run 中唯一一次 fail。

对使用者的具体影响

依赖材料引用的研发团队需特别注意。材料约束 12.10 分表明,在法律合同审查、学术文献总结、产品规格核对等场景中,Gemini 2.5 Pro 可能输出无法在给定材料中找到的引用。代码执行 23.50 分则提示重度 Python 脚本调试的团队同样面临较高失败风险。

对已将 Gemini 2.5 Pro 接入生产流程的企业,建议立即增加人工引用核验环节。探针 fail 信号独立于题目难度,说明问题不随任务复杂程度自动消失。

战略判断

当日数据支持的判断是:Gemini 2.5 Pro 在引用真实性控制上出现明显短板,需持续观察后续 run 是否重复触发探针。其他模型探针得分普遍在 55 分以上,Gemini 2.5 Pro 的 25.00 分构成独立风险点。

选型时,代码执行与材料约束双低且诚信 fail 的组合,比单一维度低分更值得优先排查。下一期 Smoke 快测的探针得分将成为关键验证信号。


数据来源:赢政指数 (YZ Index) | Run #288 | 查看原始数据