每家部署AI的企业都希望确认:系统是否在其用例和数据下可靠、安全运行。但简单连接并运行测试并非易事。
隐私与完整性的双重挑战
银行等部署方需保护敏感数据,前沿实验室则严格守护模型权重。更关键的是,基准提供商必须同时具备技术和法律措施,防止模型通过学习污染基准。单纯保密评估本身并不足够,还需完善的基准管理程序。
首次双盲评估概念验证
为展示顶级基准完整性,MLCommons与Google DeepMind、OpenMined及AVERI合作,开展首次闭源模型双盲评估。该方法通过密码学保障,确保评估组件既可使用又不污染基准。
AILuminate™安全基准的保留子集被用于此次验证,确保Google DeepMind模型此前从未接触过该评估集。AVERI借助OpenMined的安全计算,在容器化环境中运行提示,同时为模型权重和评估提供可证明保护。
各方利益的结构化保护
此次概念验证中,AILuminate在不暴露测试数据给开发者、不暴露模型权重给MLCommons或AVERI的前提下,完成了AI系统可靠性表征。
向行业标准迈进
MLCommons已将类似方法应用于最敏感的健康信息学领域,通过MedPerf项目构建可信执行环境(TEE),实现多方加密数据联合评估而不泄露信息。
未来,AI采用者可快速运行针对特定部署的可信评估。模型、数据与测试的保密性保障,加上独立机构提供的全新提示,将为AI采用、部署和可靠运营提供最清晰的决策依据。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接