Claude Opus 4.7 与 GPT-5.5 与 GPT-6 Astra 与 GPT-6.1 Sol并列86.25分:2026-10-02 Smoke快测数据简报
2026-10-02 赢政指数 Smoke 快测覆盖 15 个模型,Claude Opus 4.7 与 GPT-5.5 与 GPT-6 Astra 与 GPT-6.1 Sol 以 86.25 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
最新AI模型测评、对比评价、深度分析
2026-10-02 赢政指数 Smoke 快测覆盖 15 个模型,Claude Opus 4.7 与 GPT-5.5 与 GPT-6 Astra 与 GPT-6.1 Sol 以 86.25 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-10-01 赢政指数 Smoke 快测覆盖 15 个模型,豆包 Pro 以 95.52 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
本期WDCD v3.1测试显示5个模型全部上涨,Qwen3 Max提升20.2分、GLM-4.6提升19.9分,Grok 4仍以100分保持首位。无模型下降,守约生存与约束记忆得分普遍改善,提示生产接入时对数据边界和安全合规场景的可用性提升。
WDCD v3.1试点数据显示,工程规范场景全体得分最低,豆包-pro仅2.45/4;安全合规场景区分度最大,qwen3-max垫底2.8/4。Claude系列与豆包出现明显偏科,差距达1.45分,为企业接入生产流程提供场景级守约参考。
v2锚点8题测试显示,11个模型R1平均确认率0%、R2抵抗率0%、R3诚信率0%,R3完全崩溃0/110次。所有模型在约束注入阶段即未确认,守约能力在锚点题上呈现一致性失效。
Grok 4 以 WDCD 100.00 分位列第一,豆包 Pro 75.30 分垫底,头部尾部差距 24.7 分。11 个模型中满分率 64.5%,R3 崩溃率 0%。GLM-4.6 与 Qwen3 Max 本期分别提升 19.9 分和 20.2 分。
今日Smoke评测中,GPT-o3代码执行从93.80分跌至72.00分(-21.8),材料约束从49.30分升至82.80分(+33.5),主榜从73.78分升至76.86分,诚信评级由warn转为pass。单日10题抽签导致的波动是主因。
Claude Opus 4.7今日Smoke评测代码执行从100.00降至72.00,材料约束从56.00升至85.00,主榜从80.20降至77.85。单日10题测试下,代码执行-28分与材料约束+29分形成鲜明对比,需区分题目抽签波动与真实能力变化。
2026-09-30 赢政指数 Smoke 快测覆盖 10 个模型,Qwen3 Max 以 84.51 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
MLCommons金融服务工作组的Agent Reliability Profile成功入围C:>DIR全球“Agentic Regulator”黑客马拉松决赛。该框架旨在解决AI代理在金融领域的授权与监督空白,通过Profile Builder和Profile Validator两款工具,实现从机构证据到Level 1断言配置文件的编译,再到Level 2验证配置文件的实际行为测试。项目聚焦开放银行数据共享与同意场景,验证代理是否严格遵守客户授权范围。决赛将于9月15-16日进行现场演示,获奖结果9月18日公布。该倡议由Mike Hsu和Medha Bankhwal共同领导,目前正面向金融机构、监管机构及技术贡献者开放合作。
MLCommons 发布 MLPerf Inference v6.1 基准测试最新结果,参与机构数量创历史新高。本次更新新增端到端 RAG 和边缘代理推理两项测试,反映 AI 推理部署趋势,同时支持投机解码优化。结果显示,视觉语言模型性能较六个月前提升 2.99 倍,Deepseek R1 测试性能较一年前提升 5.7 倍。共有 30 家机构提交结果,包括 AMD、NVIDIA 等多家厂商,凸显 AI 技术快速演进。MLPerf 基准为行业提供可信性能数据,助力用户做出明智采购决策。
MLPerf Inference v6.1创下新纪录,共有30家提交者参与,涵盖硅厂商、系统集成商、云服务商及推理软件公司。本轮标志着行业向agentic和端到端基准测试的明显转向,同时涌现大量新型硬件。Datacenter套件最受欢迎的基准已从Llama2-70b转向gpt-oss-120b,体现MoE模型受重视程度提升。性能方面,VLM与DeepSeek R1在Offline和Server场景下提升显著,主要得益于Nvidia Vera Rubin新硬件。Llama2-70b历经6轮,Server场景中位每加速器性能提升5.58倍。多节点提交数量达历史新高16个,最大系统规模突破至512加速器。本轮还新增End-to-End RAG和Agentic Edge Inference等基准,持续推动AI推理评测向真实应用场景靠拢。
MLCommons 近日宣布成为欧盟地平线欧洲计划资助的 AIRIS 项目联合体成员。该项目汇集欧洲、加拿大和美国 21 家合作伙伴,获得 1690 万欧元资助,旨在开发融合生物知识与临床数据的生成式 AI 平台。MLCommons 将主导构建全面评估框架与基准套件,覆盖准确性、鲁棒性、公平性、可解释性和可用性等维度,并针对五类疾病领域及患者亚群偏差检测进行专项测试。项目将通过迭代评估与开放基准,推动机制驱动的生物医学 AI 成为科研可信工具,助力疾病机制发现与个性化医疗发展。
MLPerf Training 将从 2026 年 10 月 v6.1 提交轮次起新增 LLM 后训练基准,补充现有预训练测试。该基准采用 RLVR 方法,结合蒸馏、强化学习与监督微调,使用 Qwen 3.5 397B 模型和 R2E-Gym 数据集,目标是在 1024 GB300 小时内完成真实代理软件工程任务。基准强调模型质量与吞吐量平衡,防止奖励黑客攻击,并考察长上下文 KV 缓存管理。提交者需在有限预算下优化多轮 rollout 性能,此举反映后训练已成为 LLM 性能提升的关键路径。
SGLang团队推出SSD Expert Pack技术,将MoE模型的专家权重存储于NVMe SSD,仅按需加载路由选中的专家。通过Expert Pack布局、直接I/O、固定暂存和GPU缓存等优化,将海量参数模型部署到消费级硬件成为可能。文章详述了传统GGUF路径的局限、专家级连续布局设计,以及移除页缓存拷贝的关键优化,实现了RTX 5090单卡运行超大规模MoE模型的实用方案,并对比了预填充与解码吞吐及缓存命中率。
SGLang、Qwen 与 NVIDIA 团队联合推出 NVFP4 KV Cache 方案,基于 Blackwell 架构的 NVFP4 格式,通过双级缩放策略将 KV 缓存压缩至约 FP8 的 56%。该方案在 SGLang 中实现初始预填充、块状扩展和解码三条路径,支持长上下文与多轮 Agent 会话。实验显示,在 Qwen3.5-397B-A17B 和 Qwen3.8-27B 上精度损失极小(<1.6%),解码吞吐提升 26-30%,同时显著降低显存占用,为大规模 Agent 推理提供高效支持。
本文探讨如何利用 SGLang 高效服务 JEV-like 决策模型。通过点式与集合式提示设计,结合 Score API 与 MIS 执行优化,显著降低多候选决策的尾延迟。基准测试显示,在 Qwen3 系列模型上,MIS 在高负载下将 p95 延迟控制在较低水平,且随候选数量增加几乎保持平坦。文章详细对比 Generate、SIS 和 MIS 三种方案,并强调显式标签评分与共享查询计算的重要性,为实际部署提供实用指导。
2026-09-29 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 GPT-5.5 以 80.2 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GPT-o3今日Smoke评测主榜从96.01跌至80.78分,代码执行单项暴跌24.5分至72.50,材料约束微降3.9分。工程判断保持100分,任务表达反升15分。分析显示此次大跌最可能源于2题抽签波动,而非模型整体退化。
Claude Opus 4.7今日Smoke评测主榜从96.01分跌至82.16分,代码执行从97.00分跌至75.00分,降幅22分;材料约束小降3.9分,任务表达从50.00分升至80.00分,工程判断维持100.00分。