测评 Gemini 2.5 Pro崩了:稳定性暴跌23分背后的工程判断力不足 Gemini 2.5 Pro本周稳定性评分从54分暴跌至31.2分,跌幅达22.8分。深度分析显示,该模型在面对严格测试题时出现系统性失败,暴露出Google在追求性能提升时对工程判断力的忽视。 Gemini 2.5 Pro 模型稳定性 Google AI 工程判断力 2026年3月22日 581