跳至正文
赢政天下 AI
首页 资讯 测评 AI 专题 赢政指数 Lab WDCD

AI测评与评价

最新AI模型测评、对比评价、深度分析

GPT-o3以96.93分居首:2026-08-18 Smoke快测数据简报

2026-08-18 赢政指数 Smoke 快测覆盖 10 个模型,GPT-o3 以 96.93 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
35 2小时前

DeepSeek V4 Pro代码执行暴跌41.7分 主榜单日跌19.2

DeepSeek V4 Pro今日Smoke评测主榜从70.44分跌至51.24分,代码执行从66.70分直接跌至25.00分,材料约束反而升至83.30分。单日41.7分降幅远超正常抽签波动范围,需持续观察。

DeepSeek V4 Pro 代码执行 Smoke评测
29 1天前

Claude Opus 4.7 与 Grok 4并列96.99分:2026-08-17 Smoke快测数据简报

2026-08-17 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Grok 4 以 96.99 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
490 1天前

Claude Sonnet 4.6代码执行从100分跌至75分 主榜下滑5.5分

今日Smoke评测中,Claude Sonnet 4.6代码执行从100.00分降至75.00分,材料约束从56.70分升至75.00分,主榜从80.52分跌至75.00分。工程判断(侧榜,AI辅助评估)从100.00分降至60.50分。单日10题测试下,此类波动需结合多日数据判断是否为抽签影响。

Claude Sonnet 4.6 代码执行 Smoke评测
257 2天前

Claude Opus 4.7代码执行75.00分 材料约束100.00分 主榜反升3.7

Claude Opus 4.7今日Smoke评测代码执行从99.60分跌至75.00分,材料约束从61.70分升至100.00分,主榜从82.55分升至86.25分。工程判断降11.1分,任务表达持平。单日10题抽样波动或为主要原因,需持续观察一致性。

Claude Opus 4.7 代码执行 Smoke评测
262 2天前

Claude Opus 4.7 周均 82.3 分波动仅 20.7,DeepSeek V4 Pro 下跌 16.8 分

2026-08-10 至 2026-08-16 Smoke 数据显示,Claude Opus 4.7 以 82.3 均分、20.7 波动领跑且稳步上升;DeepSeek V4 Pro 从 87.2 跌至 70.44,波动高达 88;GLM-4.6 出现 pass→fail→pass 诚信波动;GPT-5.5 上升 27.9 分但均分 72.1。

Claude Opus 4.7 DeepSeek V4 Pro Smoke 周趋势
236 2天前

Claude Opus 4.7 与 GPT-5.5 与 GPT-o3 与 Grok 4并列86.25分:2026-08-16 Smoke快测数据简报

2026-08-16 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 GPT-5.5 与 GPT-o3 与 Grok 4 以 86.25 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
295 2天前

DeepSeek V4 Pro材料约束55.60分代码执行维度缺失 Smoke测试主榜排名落空

DeepSeek V4 Pro今日Smoke评测因API故障导致代码执行维度数据缺失,材料约束得分55.60分,工程判断50.00分,任务表达62.50分,主榜未参与排名。单日10题快测波动正常,但执行维度完全缺测需重点关注。

DeepSeek V4 Pro 材料约束 Smoke评测
175 3天前

GPT-5.5材料约束暴跌15.2分 代码执行反涨30分 主榜升9.7

GPT-5.5今日Smoke评测中材料约束从65.80分跌至50.60分,降15.2分;代码执行从45.00分升至75.00分,涨30分;主榜从54.36分升至64.02分。工程判断升25分,任务表达降8.3分。诚信评级维持pass。

GPT-5.5 材料约束 Smoke评测
173 3天前

Claude Opus 4.7以82.55分居首:2026-08-15 Smoke快测数据简报

2026-08-15 赢政指数 Smoke 快测覆盖 9 个模型,Claude Opus 4.7 以 82.55 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
272 3天前

Claude Opus 4.7以72.21分居首:2026-08-14 Smoke快测数据简报

2026-08-14 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 72.21 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
184 4天前

Gemini 2.5 Pro 主榜暴跌9.1分,代码执行单日狂降29.6

Gemini 2.5 Pro今日Smoke评测主榜79.41分,较昨日下降9.1分。其中代码执行从99.60暴跌至70.00,材料约束则升至90.90。单日10题抽样导致的波动值得持续观察。

Gemini 2.5 Pro 代码执行 Smoke评测
112 5天前

GPT-5.5 与 GPT-o3并列97.25分:2026-08-13 Smoke快测数据简报

2026-08-13 赢政指数 Smoke 快测覆盖 11 个模型,GPT-5.5 与 GPT-o3 以 97.25 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
212 5天前

WDCD v3.1周期追踪:豆包Pro+13.8 GPT-o3-11.6 守约排名大洗牌

WDCD v3.1试点数据显示,豆包 Pro 较 Run #271 上升 13.8 分,GLM-4.6 上升 9.9 分,Gemini 3.1 Pro 上升 6.8 分;DeepSeek V4 Pro 下降 8 分,GPT-o3 下降 11.6 分。当前 Top 5 中 Grok 4 以 94.80 分领先,GPT-o3 跌至 83.60 分。3 升 2 降格局下,守约能力分化直接影响生产流程接入决策。

WDCD 守约测试 模型动态
229 6天前

业务规则场景最低仅1.55分,Claude资源限制崩盘2分

WDCD v3.1试点数据显示,业务规则场景全体得分最低,qwen3-max仅1.55/4垫底;claude-opus-4.7在数据边界拿4/4却在资源限制跌至2/4,差距达2分。11模型中资源限制与业务规则成为最易破防场景,企业接入生产流程需针对性加护栏。

WDCD 守约测试 五大场景横评
228 6天前

R3 诚信率仅 59.1%:GPT-o3 20% 崩溃暴露三轮守约断层

基于 8 道 v2 锚点题,11 模型 R1 确认率 100%、R2 抵抗率 86%,R3 诚信率仅 59.1%,GPT-o3 R3 崩溃率达 20%。文章揭示模型先确认后崩盘的典型轨迹,并分析对生产流程接入的实际影响。

WDCD 守约测试 v2锚点题
209 6天前

Grok 4 94.80 分登顶 WDCD,Qwen3 Max 69.20 分垫底差距 25.6 分

Grok 4 以 94.80 分位列 WDCD v3.1 守约榜第一,Qwen3 Max 69.20 分垫底,11 个模型中 R3 崩溃率仅 4.5%。头部与尾部相差 25.6 分,GPT-o3 R3 直接 0 分暴露高压场景脆弱性。数据揭示不同模型在多轮施压下的真实约束保留能力。

WDCD 守约测试 AI模型排行榜
190 6天前

GLM-4.6代码执行跌12.5分 材料约束满分推主榜升5.4

GLM-4.6今日Smoke评测主榜79.38分,代码执行从75.00降至62.50,材料约束升至100.00,诚信评级从fail转为pass。单日10题抽签导致的波动最可能解释此变化,暂无模型真实退化信号。

GLM-4.6 代码执行 Smoke评测
155 6天前

Grok 4以98.41分居首:2026-08-12 Smoke快测数据简报

2026-08-12 赢政指数 Smoke 快测覆盖 11 个模型,Grok 4 以 98.41 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

赢政指数 Smoke快测 AI评测
210 6天前

豆包 Pro Smoke 评测数据全缺:API 故障主榜零参与

豆包 Pro 今日 Smoke 评测因 API 故障/超时导致 execution、grounding 等五维度数据缺失,已进入自动补跑,本期不参与主榜排名。单日 10 题快测出现完整数据丢失属于技术层面异常,而非题目抽签波动或模型退化。

豆包 Pro Smoke 评测 API 故障
146 2026年8月11日
1 2 3
赢政天下 AI

独立AI模型评测平台,自1998年起服务中文技术社区。每周对11个主流模型进行154道自动化测试,代码沙箱执行、引用逐条校验,排行榜公开透明。WDCD守约测试是业内首个多轮对话指令衰减基准,检验模型在复杂约束下的承诺兑现能力。覆盖ChatGPT、Claude、Gemini、DeepSeek、通义千问、文心一言、豆包等。

产品

赢政指数 · 综合排行 WDCD 守约测试 每周变化追踪 AI模型测评 Research Lab AI资讯 RSS 订阅

关于

关于赢政天下 评测方法论 隐私政策 使用条款

其他语言

English 日本語
AI 研究: WDCD · 多轮守约评测数据集 MaxModel 开发者文档 MaxModel · 大模型 API 网关 Konton 混沌 · AI 命理占卜 CyberFate · 赛博山海 AI 命理 Playden · 单文件 AI 游戏 东方材料 603110 暴雷 XunOPC

本评测独立运营,不接受任何AI模型厂商赞助。赢政指数所有评分均由系统自动评测生成。

引用格式:赢政指数 (2026). AI模型综合排行榜. https://www.yingzheng.com/yz-index/

数据许可:CC BY-NC 4.0

© 1998–2026 赢政天下. All rights reserved.