MLPerf Tiny:超低功耗AI的关键基准

机器学习不再只运行在数据中心。今天,它已经进入门铃摄像头、助听器、工厂传感器和电池供电的可穿戴设备。这些设备通常只有几毫瓦功耗预算,却需要实时响应,因此性能不再只是“跑得快”,还必须“足够省电”。

问题也随之出现:当参测设备形态差异巨大时,如何公平比较它们的性能和效率?同一轮提交中,可能既有60 MHz微控制器,也有支持向量扩展的RISC-V核心,还有专用Neural Processing Unit。

MLPerf Tiny正是为此而生。它由MLCommons Tiny Working Group联合EEMBC开发,目标是在架构中立的前提下,用相同工作负载、模型和测量方法,比较超低功耗系统的机器学习能力。

TinyML崛起:为什么它重要

TinyML通常指能够在微控制器和受限设备上运行的机器学习模型,模型规模一般低于200万参数,功耗从亚毫瓦到低毫瓦不等。这种能力让AI进入云端推理和手机推理难以覆盖的场景。

到2026年,典型应用已经包括:

  • 工业振动传感器在设备故障前识别轴承磨损;
  • 农业传感器单次充电运行数月;
  • 助听器在本地抑制背景噪声;
  • 耳机中的Always-on关键词检测;
  • 贴片式可穿戴设备监测ECG,而无需上传原始信号。

本地推理的优势非常直接:数据留在产生的位置,带来更低延迟、更低成本、更好的隐私保护,以及对电池设备至关重要的更长续航。

与此同时,软件生态也快速成熟。TensorFlow Lite for Microcontrollers、ExecuTorch、Edge Impulse、STEdgeAI-Core、NXP eIQ,以及AndesAIRE、RUHMI等厂商专用编译器,都让模型部署到嵌入式硬件上变得更容易。但这也暴露了新的难题:不同厂商常用不同模型、数据集和测试条件给出结果,数字本身很难说明全部问题。

此前一直缺失的基准空白

为超低功耗机器学习建立公平基准并不简单。MLPerf Tiny相关论文曾指出,这类基准至少面临几类核心挑战。

  • 能耗测量必须公平。不同设备的功耗差异很大,厂商测量口径也不一致。有的包含外设、固件启动或I/O活动,有的只测推理本身,这会显著影响结果。
  • 必须适配极小内存预算。TinyML设备通常以KB级内存工作,而不是GB级内存,资源约束比手机ML严格约六个数量级。参考模型、测试框架开销和量化路径都必须塞进有限空间。
  • 软硬件高度异构。设备可能是通用MCU、神经网络处理器、事件驱动架构,甚至是存内计算系统;每家厂商又常配套自己的工具链。基准若限制过多,会抹掉被测系统真正的优化能力。

图1

图1:Tiny Machine Learning Stack在每一层都存在多样性,这使得基准标准化更具挑战。

过去,嵌入式开发者并非没有基准,但很多基准并不能回答他们真正关心的问题。CoreMark是衡量Microcontroller Unit性能的常用标准,却并非为ML工作负载设计。MLMark更接近机器学习推理,但其参考模型如ResNet-50、MobileNet和SSD-MobileNet更面向边缘AI处理器,而不是资源极度受限的微控制器;同时,它也没有把能耗作为核心指标。

这正是MLPerf Tiny要填补的空白。在TinyML中,速度和能效不是同一件事:一个模型即使运行很快,也可能迅速耗尽电池。因此,延迟和每次推理能耗必须同时测量。

MLPerf Tiny由来自产业界和学术界的50多家机构共同推动,包括Harvard、Google、STMicroelectronics、Qualcomm、Syntiant、Renesas、Infineon、CERN和Silicon Labs等。各方花费约18个月构建基准套件,并在2021年6月以v0.5形式发布首批公开结果。

MLPerf Tiny到底测什么

MLPerf Tiny要回答的问题很直接:如果所有设备运行同一个ML任务,哪套硬件与软件栈执行得最高效?

为此,它评估三项指标:accuracylatencyenergy per inference。每个任务都有固定质量目标,因此参测系统是在等效精度下比较速度和能耗,而不是通过牺牲准确率换取更漂亮的数字。

其中,能耗是MLPerf Tiny最关键的差异化指标。在TinyML场景下,如果某设备一次推理只需10 ms,但能耗是竞争对手的两倍,它很可能并不是更好的选择,因为电池寿命往往才是系统约束。MLPerf Tiny使用EEMBC的EnergyRunner测试框架,对被测设备进行校准后的功耗测量,使不同芯片之间的能耗结果可以直接比较。

MLPerf Tiny也强调modular设计。优化可以来自芯片、编译器、运行时或模型本身,但参考任务保持固定,确保所有提交都面对同一把尺子。

Visual Wake Words为例,所有提交都必须判断一张96×96图像中是否有人,并在官方测试集上达到至少80%准确率。由于问题、规则和精度门槛完全一致,结果才具备可比性。例如,ASYGN的ColibriNPU每次推理仅消耗22.2 microjoules。按照这一能耗水平,一颗CR2032纽扣电池理论上可以支持每秒一次推理,持续超过三年。

图2

五项基准对应的真实场景

MLPerf Tiny在2021年的v0.5版本中包含四项任务,并在2025年的v1.3扩展到五项。每项任务都对应一种常见TinyML部署模式:

  • Keyword Spotting,KWS:使用在Google Speech Commands数据集上训练的小型DS-CNN,代表智能音箱、耳机和助听设备中的唤醒词与语音命令检测。
  • Visual Wake Words,VWW:使用面向96×96图像的MobileNetV1二分类器,模拟门铃、安防摄像头和占用检测传感器中的低功耗视觉“是否有人”判断。
  • Image Classification,IC:在CIFAR-10上运行ResNet风格网络,代表边缘设备上的通用低分辨率视觉分类任务。
  • Anomaly Detection,AD:使用在工业机器声音数据ToyADMOS上训练的自编码器,代表预测性维护和设备状态监测。
  • Streaming Wake Word:在v1.3中加入,采用1D depthwise-separable CNN,在连续音频流中检测目标词。与其他基准不同,它还关注设备在空闲和持续监听状态下的表现,更贴近Always-on语音设备的真实功耗压力。

v1.4透露的方向:边缘AI进入能效竞争阶段

MLPerf Tiny v1.4的意义不只是发布一组新数字,而是进一步确认了超低功耗AI的发展方向:未来的竞争不只在模型大小和推理延迟,更在于端到端能效、工具链成熟度以及硬件对特定工作负载的适配能力。

对于开发者和采购方来说,这类基准的价值在于降低比较成本。面对MCU、RISC-V、NPU等截然不同的平台,MLPerf Tiny通过统一模型、数据、精度目标和能耗测量,让不同方案可以在同一语境下讨论。

随着TinyML进入更多现实场景,能在几毫瓦甚至更低功耗下完成可靠推理的系统,将成为下一波边缘AI应用的基础设施。MLPerf Tiny则提供了衡量这一进展的共同语言。