GPT-5.5 执行满分 86.95 分领跑 Smoke 评测,约束短板暴露
2026-07-03 Smoke 评测显示,GPT-5.5 以执行 100 分、约束 71 分拿下主榜 86.95 分首位。Claude Sonnet 4.6 紧随其后,主榜 86.12 分。豆包 Pro 则以约束 81.7 分反超执行表现
2026-07-03 Smoke 评测显示,GPT-5.5 以执行 100 分、约束 71 分拿下主榜 86.95 分首位。Claude Sonnet 4.6 紧随其后,主榜 86.12 分。豆包 Pro 则以约束 81.7 分反超执行表现
2026-06-30 Smoke 评测显示,Gemini 3.1 Pro 以 98.47 分(执行 100、约束 96.6)排名第一。Claude Opus 4.7 执行分暴跌 27.2 至 72.8,主榜跌 16 分;文心一言 4.5 主
2026-06-27 Smoke 评测显示,Claude Opus 4.7 以 97.12 分位居第一,代码执行 100 分、材料约束 93.6 分。Claude Sonnet 4.6 紧随其后,主榜 96.45 分。三个模型并列第三,主榜