Claude Opus 4.7以96.99分居首:2026-09-20 Smoke快测数据简报
2026-09-20 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 96.99 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-09-20 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 96.99 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-09-19 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 92.49 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GLM-4.6今日Smoke评测因API故障/超时导致execution、grounding、judgment、integrity、communication五维度数据完全缺失,已进入自动补跑,本期不参与主榜排名。单日10题快测中此类技术中
Qwen3 Max今日Smoke评测材料约束从90.90分跌至74.00分,代码执行从25.00分升至89.30分,主榜升至82.42分。核心发现显示两个主榜维度出现反向剧烈波动。
2026-09-18 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-09-17 赢政指数 Smoke 快测覆盖 10 个模型,GPT-o3 以 77.45 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
本期WDCD v3.1测试显示Gemini 2.5 Pro上涨25.1分、Gemini 3.1 Pro上涨17.4分,DeepSeek V4 Pro以97.70分登顶,6模型进步仅豆包Pro下降6.3分,揭示多轮施压下守约能力分化。
WDCD v3.1试点数据显示,业务规则场景垫底分仅2.25分(doubao-pro),全体模型平均表现最差;数据边界场景glm-4.6仅1.7/4拉开最大单场景差距。Claude-opus-4.7在四场景满分却在工程规范跌至3/4,dou
v2 锚点题显示 11 模型 R1 平均确认率 0.91,R2 抵抗率仅 0.36,R3 诚信率 81.8%,仅 1/110 次完全崩溃。GLM-4.6 成为唯一 R1-R3 全 0 的模型,其余模型多在 R2 崩盘后 R3 恢复。
DeepSeek V4 Pro 以 97.70 分登顶 WDCD v3.1 守约榜,Qwen3 Max 75.20 分垫底,头部与尾部差距 22.5 分。R3 崩溃率仅 0.9%,满分率 60%,显示当前模型在多轮施压下的守约稳定性已进入新
2026-09-16 赢政指数 Smoke 快测覆盖 10 个模型,Claude Sonnet 4.6 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
豆包 Pro 今日 Smoke 评测中材料约束从80.20分跌至64.30分,下降15.9分,主榜从91.09分降至83.94分。代码执行保持100.00分不变,任务表达下滑8.3分至91.70分。诚信评级维持pass。
今日Smoke评测中,Claude Opus 4.7代码执行维持100.00分不变,材料约束从80.20分跌至64.30分,主榜从91.09分降至83.94分。工程判断侧榜跌25分,任务表达侧榜升16.7分。单日10题测试下,材料约束大幅波
2026-09-15 赢政指数 Smoke 快测覆盖 10 个模型,Gemini 2.5 Pro 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GLM-4.6今日Smoke评测因API故障/超时导致execution、grounding、judgment、integrity、communication五维度数据完全缺失,已进入自动补跑,本期不参与排名,所有得分显示为“-”,无昨日对
GPT-o3今日Smoke评测主榜从85.15分跌至70.19分,代码执行单维度暴跌25分至75分,材料约束微降2.7分。工程判断保持满分,任务表达升至100分。单日10题快测下,此类波动需区分抽签与真实退化。
2026-09-14 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 DeepSeek V4 Pro 与 豆包 Pro 与 GPT-5.5 以 91.09 分并列当日首位。Smoke 为每日 10 题快测,
SGLang 和 Miles 团队联合发布对 DeepSeek-V4.1 的 Day-0 支持,针对其低比率压缩、滑动窗口注意力、流形超连接及 Engram 内存等架构创新进行了深度优化。文章详述跨层 KV 共享、稀疏检索、主机内存 Eng
GPT-5.5今日Smoke评测主榜从82.29分跌至60.87分,暴跌21.4分。代码执行97.00→75.00,材料约束64.30→43.60,工程判断维持100.00,任务表达91.70→81.70。诚信评级保持pass。
Claude Opus 4.7今日Smoke评测主榜从82.29分跌至63.59分,代码执行维度从97.00分暴跌至50.00分,材料约束则从64.30分升至80.20分。单日10题抽样下,代码执行47分跌幅主导整体下滑,需区分题目波动与真