MLPerf Inference v6.1 基准测试创参与新纪录

MLPerf Inference v6.1 基准测试创参与新纪录

MLCommons 发布 MLPerf Inference v6.1 基准测试最新结果,本次发布创下提交机构数量新高,同时引入两项符合近期 AI 推理部署趋势的新测试,并首次公布多款新 AI 平台的同行评审性能结果,较一年前最高性能提升达 5.7 倍。

基准测试演进:新增测试与优化支持

MLPerf Inference v6.1 引入两项新测试,反映行业向更复杂、多步骤和代理式 AI 推理部署的演进趋势,覆盖数据中心与边缘场景。

端到端检索增强生成(RAG)基准

该测试评估多模型复杂管道的问答性能,包括嵌入模型、检索器、重排序器及 LLM 等步骤,分别测量文档语料库摄入和基于向量数据库的查询回答任务。

边缘代理推理基准

此测试聚焦从单次交互转向复杂多轮代理式工作负载,如代理编码,采用边缘模型与量化,支持单流编码工作负载和延迟指标,包含时间约束下的准确性测量及确定性工作负载性能测试。

此外,基准新增对投机解码(Speculative Decoding)优化的支持,该技术可在单次前向传递中预测并验证多个 token,已应用于交互场景和 GPT-OSS 任务。

提交结果彰显 AI 创新速度

本次基准收到 30 家机构提交,创下新高,包括 AMD、NVIDIA、Intel 等。新硬件包括 AMD Ryzen AI Max+ 395、AMD Instinct MI350P、Intel Arc Pro B70,以及预览中的 NVIDIA Rubin 和 Vera Rubin NVL72。最大系统包含 512 个加速器,还出现首款异构系统。

性能持续突破纪录:视觉语言模型(VLM)服务器场景每加速器结果较 v6.0 提升 2.99 倍;Deepseek R1 测试较 v5.1 提升 5.7 倍。

行业广泛参与与未来展望

首次提交者包括 Atlas Inference、Crusoe 等六家机构。超过 50% 提交者采用 MLPerf 新 API 中心化 harness,为下一代 MLPerf Endpoints 基准奠定基础。

结果详情可通过 MLCommons 官网及可视化仪表盘查看。