GLM-4.6 Smoke测试材料约束71.90分 代码执行与诚信维度双缺
GLM-4.6今日Smoke评测因API故障导致代码执行与诚信维度缺失,仅材料约束71.90分、工程判断63.90分、任务表达50.00分,主榜不参与排名。单日10题测试波动属正常,但缺失维度指向接口层面问题而非模型能力退化。
GLM-4.6今日Smoke评测因API故障导致代码执行与诚信维度缺失,仅材料约束71.90分、工程判断63.90分、任务表达50.00分,主榜不参与排名。单日10题测试波动属正常,但缺失维度指向接口层面问题而非模型能力退化。
豆包 Pro 今日 Smoke 评测因 API 故障/超时导致 execution、grounding 等五维度数据完全缺失,已触发自动补跑,本期不参与主榜排名。无昨日对比得分可供分析,核心判断为技术层异常而非模型能力退化。
2026-08-06 赢政指数 Smoke 快测覆盖 9 个模型,Claude Sonnet 4.6 与 DeepSeek V4 Pro 以 92.17 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full
本期WDCD v3.1测试中,GPT-o3上升9.5分、Gemini 2.5 Pro上升7.6分,GLM-4.6下降14.9分、Claude Sonnet 4.6下降10.8分。Grok 4以97.50分保持首位,11模型中3降2升,守约能
WDCD v3.1五大场景横评显示,安全合规全体得分最低,gpt-5.5仅1.8/4;工程规范区分度最小,11模型最低3.2/4。claude-opus-4.7与gpt-5.5偏科差距达2.2分,企业接入生产流程需按场景加护栏。
v2锚点题数据显示,11模型R1确认率91%、R2抵抗率68%、R3诚信率54.5%,豆包Pro R1=0全轮0分,Grok 4、GPT-o3、DeepSeek V4 Pro等6模型R3零崩溃。分析聚焦多约束场景下先确认后崩盘模式,为生产接
WDCD v3.1守约测试显示,Grok 4以97.50分位列第一,豆包Pro以68.00分垫底。R3崩溃率仅5.5%,满分率51.8%。Claude Opus 4.7下滑5.9分,GLM-4.6下滑14.9分,GPT-o3上升9.5分。头
2026-08-05 赢政指数 Smoke 快测覆盖 9 个模型,DeepSeek V4 Pro 与 GPT-5.5 与 GPT-o3 以 80.52 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周
GLM-4.6今日Smoke评测因API故障/超时,execution与judgment维度数据缺失,自动进入补跑,本期不参与排名。材料约束得分51.80分,任务表达50.00分,其余维度为空。单日10题快测波动属正常,但完整性受损需关注。
豆包 Pro 今日 Smoke 评测因 API 故障导致 execution、grounding、judgment、integrity、communication 五维度数据完全缺失,主榜排名取消。单日 10 题快测中出现此类全维度超时,需
2026-08-04 赢政指数 Smoke 快测覆盖 9 个模型,Gemini 2.5 Pro 以 89.56 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-08-03 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 95.19 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GLM-4.6今日Smoke评测因API故障/超时导致integrity与communication维度缺失,主榜得分74.00,代码执行82.30,材料约束95.00,工程判断70.80,任务表达无数据,已进入自动补跑且不参与本期排名。
2026-07-28至2026-08-02七天Smoke数据中,Qwen3 Max从59.28分升至96.1分,趋势+36.8;Gemini 3.1 Pro从100分跌至94.45分,趋势-5.6。Claude Opus 4.7与Gemin
2026-08-02 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 96.7 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
MLPerf自2018年推出以来,已成为衡量AI系统性能的行业标准,追踪到大语言模型推理能效提升超100倍、训练速度提升超50倍。随着AI服务广泛应用,企业采购推理算力需求日益复杂,MLCommons正式推出MLPerf Endpoints
SGLang 与 Miles 携手 Moonshot AI 和 NVIDIA,为 2.8 万亿参数的 Kimi K3 模型提供 Day-0 支持。该混合架构融合 KDA 线性注意力与 MLA,带来全新内存管理、统一内存池及 DSpark 推
本文介绍了Miles团队在Blackwell架构上实现的两种原生低精度RL方案:端到端MXFP8与MoE专家per-token NVFP4。通过从checkpoint转换、Megatron训练、SGLang rollout到实时权重更新的全
RadixArk 与 Google Cloud 达成合作,将 SGLang 推理框架引入 TPU 平台,为开发者提供硬件选择的灵活性。SGLang 已获超 3 万 GitHub 星标,支持 Gemma、Qwen 等主流模型及 Wan、Flu
量化已成为高吞吐 LLM 服务不可或缺的核心技术。随着检查点格式、模型架构和硬件后端数量激增,量化栈维护难度不断上升。本文详细解析 SGLang 团队与 Ascend 团队提出的架构重构方案,将检查点解析、参数注册、权重加载、后处理与内核执