Gemini 2.5 Pro 与 Gemini 3.1 Pro并列92.44分:2026-07-17 Smoke快测数据简报
2026-07-17 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 2.5 Pro 与 Gemini 3.1 Pro 以 92.44 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结
2026-07-17 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 2.5 Pro 与 Gemini 3.1 Pro 以 92.44 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结
2026-07-16 赢政指数 Smoke 快测覆盖 9 个模型,Grok 4 以 94.15 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-15 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 Gemini 2.5 Pro 与 GPT-5.5 以 100 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同
2026-07-14 赢政指数 Smoke 快测覆盖 11 个模型,DeepSeek V4 Pro 以 91.46 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-13 赢政指数 Smoke 快测覆盖 10 个模型,Gemini 2.5 Pro 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-12 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Claude Sonnet 4.6 与 DeepSeek V4 Pro 与 Grok 4 以 96.99 分并列当日首位。Smoke 为
2026-07-11 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Claude Sonnet 4.6 与 GPT-o3 以 81.44 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号
2026-07-10 赢政指数 Smoke 快测覆盖 9 个模型,GPT-o3 以 86.9 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-09 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 90.51 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-08 赢政指数 Smoke 快测覆盖 10 个模型,DeepSeek V4 Pro 以 95.19 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-07 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Grok 4 以 96.99 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-06 赢政指数 Smoke 快测覆盖 11 个模型,豆包 Pro 以 83.91 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-05 赢政指数 Smoke 快测覆盖 11 个模型,豆包 Pro 与 Gemini 3.1 Pro 以 88.54 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Opus 4.7在今日Smoke评测中主榜暴跌9.6分,代码执行维度从100分跌至75分,引发退化疑虑。但材料约束升至85.8分,工程判断(侧榜)大跌20分。分析显示,这或是抽签波动,而非真实退步,诚信评级仍为pass,无需过
WDCD守约测试试点揭晓:Gemini 3.1 Pro与Qwen3 Max并列第一(65.00分),Grok 4垫底(42.50分)。头部梯队稳健,R3崩溃率高达69.1%。Gemini系列迭代提升明显,Grok大跌7.5分,凸显AI守约能
Gemini 2.5 Pro在今日Smoke评测中主榜得分从74.00升至87.54,诚信评级从fail转为pass,但工程判断(侧榜)暴跌28.4分至30.00。分析显示,这或是抽签波动而非真实退化,但需警惕潜在不稳定性。核心维度材料约束
横向对比赢政指数、SuperCLUE、OpenCompass、C-Eval 四大中文AI评测基准,从代码执行、长文档理解、诚信检测、约束衰减四个维度分析各自优劣。
在同一道SQL题“连续登录天数”中,11个AI模型表现分化:豆包Pro、文心一言等8款满分100分,DeepSeek V4 Pro、GPT-o3等3款0分。分析揭示,成功者巧用ROW_NUMBER()分组,失败者语法或逻辑崩盘,凸显代码执行
WDCD的意义不只在榜单分数,而在揭示行业盲区。Run #105中110个案例有59例完美开局最终溃退,Q239更是11/11全军覆没。没有模型R3满分,行业一直在测量智力却忽略了纪律,WDCD填补了多轮行为一致性这个关键评测空白。
WDCD三轮衰减实测:R1确认率95%,R3诚信率仅29%,330次施压有209次完全崩溃。Grok 4 R3崩溃率高达86.7%,连Claude Sonnet 4.6也在只读账号、内存限制等约束下当场翻车。嘴上答应身体诚实,是大模型守约测