Qwen3 Max主榜暴跌12分至74,诚信fail拉低整体
2026-06-23 Smoke评测显示,Qwen3 Max主榜74分暴跌12分,诚信从pass转为fail。Claude Opus 4.7、Gemini 3.1 Pro、Grok 4三模型以执行100、约束100拿下满分主榜。文心一言4.
2026-06-23 Smoke评测显示,Qwen3 Max主榜74分暴跌12分,诚信从pass转为fail。Claude Opus 4.7、Gemini 3.1 Pro、Grok 4三模型以执行100、约束100拿下满分主榜。文心一言4.
2026-06-14 Smoke评测显示,GPT-5.5主榜95.24分(执行96、约束94.3)位居第一。豆包Pro、Qwen3 Max主榜均暴跌31.1分,主要源于代码执行分别下跌61.6分和78.3分。Gemini 3.1 Pro执行