MLPerf Endpoints v0.7:AI推理基准奠基发布

MLPerf自2018年推出以来,一直是衡量AI系统性能的行业标杆。在此期间,MLPerf记录到大语言模型推理每瓦性能提升超过100倍,训练速度提升超过50倍。过去八年间,AI行业日趋成熟,AI服务已为全球企业和消费者日常使用。

推出MLPerf Endpoints的背景

MLPerf最初旨在帮助少数云服务商和系统构建者做出AI硬件采购决策。如今,采购推理算力已成为各规模企业的关键商业决策,需要同时评估新云、云服务商及托管服务。这些买家需要可靠、可比且独立的性能基准,且基准必须动态跟上每周发布新模型的行业节奏。

四大核心原则

MLPerf Endpoints正是为满足这一多元复杂需求而设计,其开发遵循四大买家导向原则:

  • Current(当前性):结果需与市场同步,买家无需等待数月才能纳入新硬件或模型。
  • Comprehensive(全面性):覆盖众多竞争性推理提供商、系统及工作负载。
  • Comparable(可比性):提供跨厂商的苹果对苹果对比,支持成本或功耗归一化。
  • Commentary(洞察性):通过可视化、数据筛选和分析提供额外决策上下文。

v0.7版本亮点

MLPerf Endpoints v0.7作为奠基版本,已发布Coreweave、Google、Intel、KRAI和Nvidia的首批结果,覆盖3个基准,性能跨多个数量级。该版本支持自动化提交管道、持续审查工具及动态结果可视化,可在mlcommons.endpoints.com查看。规则正向更买家中心的方向演进。

未来规划与参与

今年晚些时候将推出v1.0版本,包含更多买家导向规则、归一化处理及扩展基准(含代理工作负载),并向更广泛成员开放滚动提交流程。MLCommons感谢30多家支持者,包括AMD、Argonne National Laboratory、Broadcom等。系统或服务提供商可立即参与规则制定并提交;企业买家可通过邮箱反馈需求。