MLPerf Endpoints v0.7:AI推理基准奠基发布
MLPerf自2018年推出以来,已成为衡量AI系统性能的行业标准,追踪到大语言模型推理能效提升超100倍、训练速度提升超50倍。随着AI服务广泛应用,企业采购推理算力需求日益复杂,MLCommons正式推出MLPerf Endpoints
MLPerf自2018年推出以来,已成为衡量AI系统性能的行业标准,追踪到大语言模型推理能效提升超100倍、训练速度提升超50倍。随着AI服务广泛应用,企业采购推理算力需求日益复杂,MLCommons正式推出MLPerf Endpoints
随着AI从数据中心走向门铃、助听器、工业传感器和可穿戴设备,如何公平衡量毫瓦级设备的性能与能效成为关键问题。MLPerf Tiny通过统一模型、任务、精度目标和能耗测量方法,为TinyML硬件与软件栈提供可比较的标准。
MLCommons提出Agentic Inference基准,将多轮智能体推理纳入MLPerf Endpoints框架。新基准覆盖编码助手与企业工作流两类真实轨迹,重点衡量长上下文、KV-cache复用、可变输出长度和闭环多轮依赖下的端到端
MLCommons Edge LLM Taskforce宣布在MLPerf Inference v6.1中引入Edge Agentic Inference基准,聚焦设备端Agentic LLM在单边缘加速器上的工具调用准确率与单用户延迟表现
MLCommons与Google Cloud在Google Cloud Next 2026展示MedPerf接入Confidential Space,用于脑肿瘤MRI分割模型的联邦基准评测。该方案在不迁移患者数据的前提下,同时保护模型权重、
MLCommons指出,AI系统与传统软件不同,其评估发现具有双重用途、无法通过补丁修复,且开放权重模型的危害会永久存在。协调漏洞披露(CVD)模式因此失效。文章分析了三大核心挑战:发现易被滥用、过度反馈会污染测试、无法集中修复模型。MLC
MLCommons Chakra 工作组于 2023 年成立,旨在解决 AI 系统快速发展带来的基准测试与软硬件协同设计难题。通过标准化执行追踪(Execution Trace),Chakra 提供了一个开放、可互操作的生态系统,支持从真实
MLCommons 正式推出 MLPerf Mobile v6.0 版本,新增针对 Android 设备运行大语言模型的生成式 AI 基准测试。该版本引入 Llama 3.2 1B、3B 及 Llama 3.1 8B Instruct 模型
MLCommons 正式发布 MLPerf Training v6.0 基准测试结果。本次更新新增 DeepSeek V3 与 GPT-OSS 20B 两项基准,突出 Mixture-of-Experts(MoE)稀疏计算架构的行业趋势。测
MLCommons公布第四届 Rising Stars 名单,39位来自全球26所机构的早期研究者从175多名申请者中脱颖而出。入选者研究覆盖大语言模型、ML系统效率、软硬件协同设计、可信AI、多模态学习及医疗、网络安全、科学计算等应用方向
MLCommons 为 MLPerf Training v6.0 引入 GPT-OSS 20B 预训练基准,用更小硬件门槛评测 MoE 稀疏训练能力。该基准通过固定验证集、优化器稳定化和统一初始化,将训练波动显著压低,目标是让成绩更真实反映
随着大型语言模型(LLM)开发日益采用稀疏计算,评估训练性能的基准也需跟上步伐。MLPerf Training v6.0新增基于DeepSeek-V3的预训练基准,这是一个拥有671B总参数的Mixture-of-Experts(MoE)架
AI系统在各个领域的应用需要明确其行为并评估其可靠性。MLCommons的AI风险与可靠性工作组专注于提高AI可靠性,这不仅能推动市场增长,还能保护社会安全。通过制定详细计划并实施,确保AI系统在不同阶段的可靠性。
AI行业每隔几个月就会推出新一代前沿模型,这些模型的能力不断提升,同时也改变了监管机构、企业和公众需要评估的风险格局。然而,用于衡量这些风险的基准并不会自动更新。本文介绍了MLCommons的AILuminate基准及其Continuous
MLCommons 近日发布 MLPerf Client v1.6,这是评估个人电脑 AI 性能的最新基准测试套件。该版本针对笔记本电脑、台式机和工作站等设备,模拟真实生成式 AI 任务,如文本摘要、内容创作和代码分析,提供响应速度和吞吐量
MLCommons近日公布了行业标准MLPerf Inference v6.0基准测试套件的最新结果。此次更新包括五个数据中心测试的新增或升级,以及边缘系统的全新物体检测测试。主要亮点有基于GPT-OSS 120B的开源大语言模型基准、扩展
MLPerf Inference v6.0 基准发布显著扩展了对开源大语言模型(LLM)的覆盖。随着行业转向更专业化开源模型,基准测试需适应部署策略与架构变化。本轮引入两大亮点:GPT-OSS 120B 新基准,基于117B参数MoE架构,
生成式AI迅猛发展,ChatGPT用户从中2023年中至2025年初增长约8倍,各大厂商模型迭代如火箭般迅猛。传统基准测试已跟不上节奏,MLPerf Endpoints应运而生,由MLCommons联合创始人David Kanter在GTC
AI作为当今采用速度最快的通用技术,其全球普及却存在显著差距,反映出数字鸿沟。MLCommons推出AILuminate Culturally-Specific Multimodal Benchmark,针对亚太地区开发文化特定的多语言多模
MLPerf Inference 基准已成为评估 AI 基础设施性能的行业标准。本次 v6.0 Edge 套件将 RetinaNet 升级为 Ultralytics YOLO11,这款现代化的单阶段目标检测模型在 COCO 数据集上 mAP