DeepSeek V4 Pro以87.2分居首:2026-08-10 Smoke快测数据简报
2026-08-10 赢政指数 Smoke 快测覆盖 10 个模型,DeepSeek V4 Pro 以 87.2 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-08-10 赢政指数 Smoke 快测覆盖 10 个模型,DeepSeek V4 Pro 以 87.2 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Sonnet 4.6 WDCD 分数从上期上升 8.8 至 83.72,豆包 Pro 下降 16 分,GPT-5.5 上升 5 分。Grok 4 以 91.04 保持首位,v3.1 试点显示多轮施压下守约生存差异扩大。
WDCD v3.1五场景横评显示,数据边界全体得分最低,doubao-pro仅1.4/4垫底;业务规则区分度最大,deepseek-v4-pro拿下4/4满分。claude-sonnet-4.6工程规范4/4却业务规则仅2.55/4,暴露明
v2锚点题数据显示,11模型中豆包Pro R3崩溃率32%,Grok 4为0%;R3完全崩溃34/275次。R1确认率90%但R3诚信率仅44.4%,揭示多数模型先确认后崩盘的典型模式,仅限8道v2题口径。
Grok 4以91.04分位居WDCD守约榜首,豆包Pro仅58分垫底,R3施压轮崩溃率达12.4%。11个模型中头部与尾部差距超过33分,Claude Sonnet 4.6单期提升8.8分,GPT-5.5提升5分。数据揭示多轮渐进施压下模
Qwen3 Max今日Smoke评测主榜从96.04分跌至85.82分,降幅10.2分。其中材料约束从91.20分跌至69.70分,降幅21.5分;代码执行仅降1分。任务表达侧榜反升32.2分。数据指向材料约束维度异常波动。
DeepSeek V4 Pro今日Smoke评测材料约束从89.50分跌至70.00分,主榜从94.07降至86.50分,代码执行反升至100.00分。单日2题抽样导致的波动需重点关注。
2026-W32 Smoke数据显示,Claude Sonnet 4.6从92.17跌至69.56,趋势-22.6;GLM-4.6波动达59.9且均值仅24.4;GPT-o3从89.2升至95.91,趋势+6.7。GPT-o3与Claude
2026-08-09 赢政指数 Smoke 快测覆盖 9 个模型,GPT-o3 以 95.91 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
豆包 Pro 在今日 Smoke 评测中因 API 故障/超时导致 execution、grounding、judgment、integrity、communication 五维度数据完全缺失,主榜得分为-,本期不参与排名。单日 10 题快
今日Smoke评测中,Claude Sonnet 4.6代码执行从94.50分跌至75.00分,材料约束从43.30分升至97.80分,主榜从71.46分升至85.26分。仅2题抽样导致的波动是主因,整体能力未见系统性退化。
2026-08-08 赢政指数 Smoke 快测覆盖 9 个模型,Claude Opus 4.7 与 GPT-o3 以 97.66 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
SpecForge v0.3.0 发布重大更新,将目标模型推理与草稿模型训练完全分离,支持在线、离线及解耦工作流,兼容 EAGLE3、DFlash、Domino 等多种算法。新架构通过 Mooncake 传输特征,SGLang 捕获目标特征
本文深入剖析了SGL-Diffusion中AR+DiT混合生成框架的性能瓶颈,并通过三阶段优化实现显著加速。采用SRT替换HF后端,解耦AR与DiT并行策略,结合动态批处理与早返回机制,大幅提升硬件利用率。实验数据显示,单卡端到端延迟降低4
HPC-Ops 是腾讯混元大规模生产推理中使用的开源算子库,其核心的 Dynamic Attention 和 Fused MoE 算子显著提升了模型性能,最高可将 Hy3 模型的 TPOT 降低 48.8%。本文详细介绍 HPC-Ops 中
Claude Opus 4.7在今日Smoke评测中代码执行从100.00分跌至69.50分,材料约束从71.90分升至95.00分,主榜从87.36分降至80.98分。工程判断升25分,任务表达升5分。诚信评级维持pass。
今日Smoke评测中Grok 4材料约束从82.60分跌至65.00分,降幅17.6分,主榜从82.99分微降至81.23分。代码执行反升11.2分至94.50分,工程判断升至100分,诚信评级从pass转为warn。单日10题快测下,这一
2026-08-07 赢政指数 Smoke 快测覆盖 9 个模型,Gemini 2.5 Pro 以 87.21 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GLM-4.6今日Smoke评测因API故障导致代码执行与诚信维度缺失,仅材料约束71.90分、工程判断63.90分、任务表达50.00分,主榜不参与排名。单日10题测试波动属正常,但缺失维度指向接口层面问题而非模型能力退化。
豆包 Pro 今日 Smoke 评测因 API 故障/超时导致 execution、grounding 等五维度数据完全缺失,已触发自动补跑,本期不参与主榜排名。无昨日对比得分可供分析,核心判断为技术层异常而非模型能力退化。