MLPerf Client v2.0 发布:新增图像生成与智能体AI基准

MLCommons近日宣布发布MLPerf Client v2.0,这是其针对个人电脑AI性能的行业标准基准测试最新版本。该工具用于评估笔记本电脑、台式机和工作站在本地运行AI工作负载的效果。

新增工作负载亮点

本次更新引入多项新功能,以适应AI硬件和软件的快速发展。

图像生成类别

新增图像生成类别,采用Flux.2 klein 4B模型作为实验性测试,大幅提升对生成式视觉能力的评估能力。

智能体AI类别

新增Agentic AI类别,通过软件工程(SWE)Agent和数据分析师Agent场景进行测试,报告端到端性能,并分解LLM推理与工具执行时间。

LLM推理测试升级

必选工作负载从Phi 3.5 mini instruct升级至Phi 4 Mini Instruct,同时引入Qwen 3 8B作为实验性测试。基础任务新增中间摘要任务,输入提示约4K tokens。

MLPerf Client v2.0由AMD、Intel、Microsoft、NVIDIA及多家PC OEM厂商共同协作完成,已在GitHub开源,开发者可免费下载并贡献代码。