MLPerf v6.1征集边缘Agentic推理基准结果

MLCommons Edge LLM Taskforce宣布,将在MLPerf Inference v6.1轮次中引入全新的Edge Agentic Inference基准。随着coding copilots、机器人控制器、私有本地助手等Agentic LLM越来越多地在设备端运行,如何在真实边缘预算下衡量模型调用工具的准确性与响应速度,正在变得越来越关键。

本轮基准首次采用Qwen3.6-27B模型(2026年4月22日发布),参考实现中以Q4_K_M GGUF量化格式运行在单个边缘加速器上。提交者也可以使用任何符合准确率门槛的允许量化方案。工作负载由两部分组成:用于确定性、无需LLM裁判的准确率门槛的Berkeley Function Calling Leaderboard v4(BFCL v4),以及用于单流性能评测的录制式agentic-coding replay。两者共同刻画了设备端Agent的真实挑战:不断增长的长工具调用对话,必须装入固定上下文窗口,并对单个交互用户保持足够响应。

提交截止日期为2026年7月31日。MLCommons邀请硬件厂商、边缘设备制造商和推理系统专家提交结果,共同提升设备端Agentic推理的评测标准。

为什么需要边缘侧Agentic AI基准

应用AI正在从单轮文本生成转向多轮Agentic工作负载。真实的Agentic会话不是“一次提示、一次回答”,而是一条连续轨迹:每一轮都会把工具输出和模型回复追加到不断增长的对话历史中;模型在短工具调用和较长推理之间切换;每一轮又严格依赖前一轮的结果。

数据中心版MLPerf Agentic benchmark(计划于9月推出)关注的是另一类问题:大规模Mixture-of-Experts模型、累计多轮上下文超过100K tokens的长周期轨迹,以及通过并发扫描得到每GPU的Pareto frontier。边缘侧则恰好相反,本次基准主要针对以下约束:

  • 固定内存与功耗预算:单个小型加速器需要同时容纳模型权重、KV cache和激活值。全精度frontier model通常无法放入,因此量化成为必要选择。
  • 单个在途请求:边缘推理主要服务一个交互用户,而不是数据中心里成千上万的并发会话。
  • 固定served context window:参考实现将served context固定为32K tokens。这不是设备上限,而是受控的基准参数,因此长轨迹可能耗尽上下文窗口,使上下文增长与截断成为可测量的一阶影响。
  • 关注单用户延迟而非总吞吐:在单slot边缘设备上,吞吐与延迟基本互为倒数,因此更重要的指标是单轮TTFTTPOT和端到端turn latency,而不是多流数据中心服务器优化的aggregate QPS或token throughput。

该基准继承了数据中心Agentic规范中的多轮方法论,包括术语、确定性replay、JSONL数据集schema和inline accuracy check,并针对边缘场景做了专门化:边缘模型与量化方案、单流负载模式、以延迟为中心的指标,以及具备统计稳健性的准确率门槛。

模型选择:Qwen3.6-27B与Q4_K_M量化

参考模型为Qwen3.6-27B,通过llama.cpp(commit cfff1fc)以Q4_K_M GGUF量化形式提供服务,GGUF文件来自unsloth/Qwen3.6-27B-GGUF中的Qwen3.6-27B-Q4_K_M.gguf

MLCommons选择Qwen3.6的原因在于,它是一个开放(Apache 2.0)、具备较强工具调用能力的模型,并带有原生MTP speculative-decoding head。尽管它是27B dense模型,阿里巴巴报告称其在主要代码基准中超过此前397B-MoE旗舰模型,并在SWE-bench Verified上达到77.2%。同时,它具备较好的部署便利性:官方权重发布在Hugging Face和ModelScope,社区GGUF版本也可直接在llama.cpp下运行。

量化是边缘部署的关键选择。Q4_K_M属于4-bit K-quant的“Medium”档:权重以每值4 bit存储,相比BF16带来约4倍内存压缩;attention blocks相比feed-forward blocks保留更高精度;并通过importance-weighted(imatrix)校准保留影响最大的权重。最终,27B模型约需16.5GB VRAM即可运行,而BF16约需54GB,代价是约2%至5%的准确率损失。这正是“能在边缘GPU上运行”和“无法运行”之间的差别。

参考采样参数

ParameterValue
temperature0
top_k1(temperature=0时不产生实际影响)
top_p1.0(temperature=0时不产生实际影响)
seed42
max_new_tokens1024
repetition_penalty1
reasoningoff
context size32768(32K)
parallel slots1

在这一工具调用工作负载中,reasoning被有意关闭,因为它会降低单轮准确率,同时显著增加耗时。MLCommons表示,该基准已经在多个厂商的一系列边缘加速器上完成验证,说明工作负载和方法论具备可移植性。

基准任务:准确率与性能双数据集

该基准使用两个承担不同角色的数据集。

准确率数据集:BFCL v4

Berkeley Function Calling Leaderboard v4(BFCL v4)用于测试模型是否能够正确、确定性地调用函数,且不依赖LLM judge。它覆盖单轮请求,即“一个prompt到一个结构化tool call”,主要分为三类:

  • non_live:通过AST match与gold labels比对。
  • live:同样通过AST match评测。
  • hallucination:二元检查,当可用工具与问题无关时,模型是否能拒绝调用函数。

此外,BFCL v4还包含可选的多轮Agentic对话,并通过进程内Python simulators执行。类别来自公开的gorilla-llm/gorilla-eval-set,会在运行时自动下载。

本轮计分门槛仅使用单轮集合,并按类别采样到稳定的约995个样本点估计:non_live占72%(约712个样本)、live占17%(约171个样本)、hallucination占11%(约112个样本)。同时设置subset_floor为25,因此任何条目数不超过25的子集都会完整纳入。

性能数据集:录制式Agentic Coding Replay

性能数据集来自MLPerf Agentic benchmark的一个子集,包含录制好的多轮agentic coding轨迹。这些任务采用类似SWE-bench的形式,来自真实代码仓库,例如astropy,并以确定性replay方式作为性能工作负载,规模则调整为适合单设备边缘服务。

参考集合包括20段对话、1,007个turn,设计目标是所有轨迹都不会溢出32K-token served context,峰值输入长度约为23.5K tokens。由于没有发生上下文溢出,每个turn都能完成;在并发为1、一次仅处理一个在途请求的情况下,单个边缘设备可以在合理时间内完成一次完整运行,且有效运行要求为零丢弃turn

该数据集本身也充当ground truth:每条轨迹中录制的工具调用会驱动零成本inline accuracy check,并在延迟测量过程中同步运行。准确性采用executed calls的multiset IOU进行检查,因此正确性与延迟来自同一次执行。

请求与响应示例

单轮function-calling请求会发送到模型兼容OpenAI格式的/v1/chat/completions端点,并携带可用工具schema。例如,用户询问旧金山当前摄氏温度时,请求中可包含如下工具定义:

{
  "messages": [
    {
      "role": "user",
      "content": "What is the current temperature in San Francisco, in Celsius?"
    }
  ],
  "tools": [
    {
      "type": "function",
      "function": {
        "name": "get_current_weather",
        "description": "Get the current weather for a given location.",
        "parameters": {
          "type": "object",
          "properties": {
            "location": {
              "type": "string",
              "description": "City and state, e.g. San Francisco, CA"
            },
            "unit": {
              "type": "string",
              "enum": ["celsius", "fahrenheit"]
            }
          },
          "required": ["location", "unit"]
        }
      }
    }
  ]
}

模型应返回结构化工具调用:

{
  "choices": [
    {
      "message": {
        "role": "assistant",
        "tool_calls": [
          {
            "type": "function",
            "function": {
              "name": "get_current_weather",
              "arguments": "{\"location\": \"San Francisco, CA\", \"unit\": \"celsius\"}"
            }
          }
        ]
      },
      "finish_reason": "tool_calls"
    }
  ]
}

BFCL v4的AST checker会将预测调用与gold label逐项对比,包括函数名和每个参数,因此评分具备精确性与可复现性。

意义

这项Edge Agentic Inference基准把评测重点从传统吞吐转向设备端Agent真实体验:在有限内存和功耗下,模型能否在长上下文、多轮工具调用中保持准确,并为单个用户提供可接受的响应延迟。对于希望证明边缘AI推理能力的芯片、设备和系统厂商来说,MLPerf Inference v6.1提供了一个更贴近下一代设备端AI应用的公开衡量框架。