测评 如何判断AI基准测试是否值得信赖 在企业AI应用中,基准测试分数常被用作模型选型和采购决策的依据,但部分结果存在“benchmark washing”问题。本文基于MLCommons多年实践,提出七项信任测试准则,涵盖基准相关性、数据污染控制、可复现性、指标完整性、模型作弊 MLC AI基准测试 企业AI 模型评估 5小时前 49
测评 AI评估披露困境:传统补丁模式为何失效 MLCommons指出,AI系统与传统软件不同,其评估发现具有双重用途、无法通过补丁修复,且开放权重模型的危害会永久存在。协调漏洞披露(CVD)模式因此失效。文章分析了三大核心挑战:发现易被滥用、过度反馈会污染测试、无法集中修复模型。MLC MLC AI安全 模型评估 负责任披露 2026年6月29日 476