Gemini 2.5 Pro 与 Gemini 3.1 Pro并列92.44分:2026-07-17 Smoke快测数据简报
2026-07-17 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 2.5 Pro 与 Gemini 3.1 Pro 以 92.44 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结
2026-07-17 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 2.5 Pro 与 Gemini 3.1 Pro 以 92.44 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结
2026-07-16 赢政指数 Smoke 快测覆盖 9 个模型,Grok 4 以 94.15 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-15 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 Gemini 2.5 Pro 与 GPT-5.5 以 100 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同
2026-07-14 赢政指数 Smoke 快测覆盖 11 个模型,DeepSeek V4 Pro 以 91.46 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-13 赢政指数 Smoke 快测覆盖 10 个模型,Gemini 2.5 Pro 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-12 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Claude Sonnet 4.6 与 DeepSeek V4 Pro 与 Grok 4 以 96.99 分并列当日首位。Smoke 为
2026-07-11 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Claude Sonnet 4.6 与 GPT-o3 以 81.44 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号
2026-07-10 赢政指数 Smoke 快测覆盖 9 个模型,GPT-o3 以 86.9 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-09 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 90.51 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-08 赢政指数 Smoke 快测覆盖 10 个模型,DeepSeek V4 Pro 以 95.19 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-07 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Grok 4 以 96.99 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-06 赢政指数 Smoke 快测覆盖 11 个模型,豆包 Pro 以 83.91 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-07-05 赢政指数 Smoke 快测覆盖 11 个模型,豆包 Pro 与 Gemini 3.1 Pro 以 88.54 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
本轮WDCD测试中,GPT-5.5与Grok 4均暴跌12.5分,5模型合计下滑,唯Qwen3 Max上涨7.5分并闯入Top3,暴露当前主流模型在多轮约束下的脆弱性。
今日Smoke评测中,Claude Sonnet 4.6 以84.68分逆袭登顶,但8大模型代码执行暴跌25分,主榜平均下滑超10分。Claude家族强势,Gemini和DeepSeek大幅滑坡,揭示AI更新风险与稳定性隐忧。GroK 4诚
今日Smoke评测中,Claude Opus以89.43分领跑,Grok 4主榜暴跌25.2分执行仅50分;Gemini系列诚信回暖主榜大涨。分析揭示模型更新风险,GPT-o3也崩23.1分,暴露AI稳定性痛点。
横向对比赢政指数、SuperCLUE、OpenCompass、C-Eval 四大中文AI评测基准,从代码执行、长文档理解、诚信检测、约束衰减四个维度分析各自优劣。
AI评测排行榜充斥虚假繁荣:AI自评、假跑代码、单次排名和赞助操控让99%结果不可信。YZ Index通过真跑沙箱、准确度检查、滚动均值和零AI裁判,提供无偏见评估,颠覆行业标准。
现有AI评测只测能力,却忽略守约可靠性。YZ Index的WDCD测试通过3轮设计和30道企业场景题,填补空白,透明判分揭示AI抗压与遗忘问题。深度解读其创新价值,帮助企业选可靠AI。
赢政指数 v7 推出实验性维度 DCD(动态语境衰变),首次系统性测量大模型在多轮对话中守住初始约束的能力。30 道题、三轮对话、五类场景、规则判分零 AI 介入——这是国内外公开评测体系中第一个针对"AI 在长对话中会不会忘掉自己承诺过什