双盲设计:构建可信AI评估的核心保障
随着AI在金融、医疗等敏感领域的广泛部署,企业迫切需要了解模型在其特定数据和用例下的可靠性和安全性。然而,传统评估方式难以兼顾数据隐私、模型权重保护以及基准完整性。MLCommons携手Google DeepMind、OpenMined与A
随着AI在金融、医疗等敏感领域的广泛部署,企业迫切需要了解模型在其特定数据和用例下的可靠性和安全性。然而,传统评估方式难以兼顾数据隐私、模型权重保护以及基准完整性。MLCommons携手Google DeepMind、OpenMined与A
人工智能行业正处于转折点,企业将AI从实验阶段推向金融、医疗和制造等关键业务时,可靠性验证成为核心障碍。MLCommons联盟(包括KPMG、Google、Microsoft和Qualcomm)推出AILuminate全球保障计划(AIL
MLCommons组织近日推出Ailuminate基准的法语数据集版本,进一步扩展多语言大语言模型(LLM)评估框架。该数据集涵盖翻译、阅读理解、常识推理等多项任务,总计超过10万条高质量法语样本,由专业标注团队构建,确保文化适应性和准确性
MLCommons与LMSYS Org联合发布的AILuminate Jailbreak V05基准测试结果新鲜出炉!本次更新引入了更先进的越狱攻击策略,覆盖化学、生物、网络安全等高风险领域。顶级模型如GPT-4o、Claude 3.5 S