MedPerf接入Google Cloud机密计算:为脑肿瘤AI评测加密护航

在拉斯维加斯举行的 Google Cloud Next 2026 上,MLCommons Medical AI 工作组与 Google Cloud 宣布,MLCommons 的联邦基准评测编排器 MedPerf 已支持 Google Cloud 的 Confidential Computing 能力。双方以一个具有现实临床价值的场景进行了演示:脑肿瘤分割。

脑肿瘤,尤其是胶质母细胞瘤(glioblastoma),虽然属于罕见疾病,却会严重影响患者预期寿命。AI 有望通过一系列自动化流程改善脑肿瘤诊断与预后判断,包括边界定义/分割、肿瘤分类以及肿瘤定量分析。

在由 Indiana University School of Medicine 的 Dr. Spyridon Bakas 协调的 Federated Tumor Segmentation(FeTS)联盟,以及 Response Assessment in Neuro-Oncology(RANO)合作组支持下,MedPerf 团队展示了如何在真实世界脑肿瘤 MRI 数据上评估一个具有临床价值的 AI 模型。该模型由 Duke University 的 Dr. Evan Calabrese 团队设计。

通过将 MedPerf 部署到 Google Cloud 的 Confidential Computing 环境中,双方希望在全球范围推动医疗 AI 研究,同时让模型能够在医疗数据上被安全评估。借助 Google Cloud Confidential Space 这一 Trusted Execution Environment(TEE),医疗数据、模型权重和基准评测流程在整个执行期间都能获得保护。

图1

问题:高危疾病与难以流动的医疗数据

在医疗场景中,保护 AI 模型和患者数据至关重要。这不仅涉及隐私与伦理,也受到数据主权和监管要求的约束。与此同时,如果要让医生、患者、监管机构和支付方真正信任并采用 AI,模型必须在真实世界患者数据上接受严格评估。

MLCommons 社区开发 MedPerf,正是为了解决这一矛盾。MedPerf 采用联邦方式进行评测,这一思路由 Dr. Bakas 团队引入医疗领域:不是要求数据移动到基准评测运营方,而是让 AI 模型移动到医疗数据所有者处,例如医疗机构、医院或数据代理方。这样,数据所有者可以继续保留数据隐私,只向基准评测方共享汇总结果。

不过,联邦评测并不能完全解决所有信任问题。它虽然降低了患者数据外泄风险,但对于模型被窃取、知识产权保护以及基准结果完整性仍存在担忧。如果缺少额外保障,模型权重可能在执行过程中泄露,评测结果也可能被篡改,这会影响参与方对基准评测本身的信任。

方案:MedPerf 运行在 Google Cloud Confidential Space 上

MedPerf 与 Google Cloud Confidential Space 的集成,正是为了解决这一核心问题:在保护医疗数据的同时,也保护模型权重和基准评测结果。

该集成为 MedPerf 用户带来四项关键能力:

  • 面向医疗 AI 的全球测试数据集:支持以前所未有的规模开展模型评估。
  • 患者数据受到保护:数据始终留在数据所有者的安全环境中,不需要外移。
  • 模型 IP 受到保护:模型权重保持加密状态,未经授权的参与方无法访问。
  • 无需共享原始数据:评测结果在传输前会被汇总并加密。

演示流程:一次端到端的安全基准评测

在演示中,基准评测机构首先在 MedPerf 服务器上发布 benchmark,说明评测目标、数据准备规范和评价标准。随后,数据所有者与 AI 模型所有者在 MedPerf 服务器上注册各自私有资产的元数据,并将这些注册信息关联到对应 benchmark。

私有资产会通过 Google Cloud 的 Cloud Key Management Service(Cloud KMS)加密,并上传到 Google Cloud Storage bucket。Cloud KMS 与 bucket 的访问权限由 Google Cloud workload identity pool 管理,只有当请求来自符合特定度量条件的 confidential virtual machine 时才会被允许访问,例如 benchmark container hash 与 input hash 必须匹配。

实际运行时,数据所有者会在 Confidential Space virtual machine 中执行 benchmark container。该容器会获得可信执行环境配置的加密证明,并用它向模型所有者和数据所有者的 workload identity pool 换取访问令牌。随后,令牌用于获取并解密模型和数据集,系统执行推理任务,再使用数据所有者的公钥对结果加密,最后将加密结果返回到数据所有者的 bucket。

图2

官方演示视频展示了一个脑肿瘤分割 AI 模型如何在 Google Cloud 上对临床数据集运行评测。

社区声音:安全、规模化与真实世界验证

Northwestern University 的 Dr. Yury Velichko 表示,在 Google Cloud 上测试 federated learning 的经历表明,医疗 AI 的未来在于安全、可扩展、协作式的云环境。将工作流从受控实验室推进到接近生产级的基础设施中,有助于在真实临床应用中评估 federated learning 的性能与安全性。FeTS 社区、MLCommons 与 Google Cloud 的合作,也展示了可扩展云方案如何加速神经放射学高精度诊断工具的开发。

Indiana University School of Medicine 的 Dr. Spyridon Bakas 强调,Federated Learning 为医疗多中心协作带来了范式转变,使研究者能够从多样化患者群体中获取前所未有的知识,从而构建更稳健、更具泛化能力、具备真实临床影响力的 AI 模型。他指出,安全与隐私是保护 FL 相关资产的首要条件,而基于 Google Cloud 上 MLCommons MedPerf 的 confidential compute 基础设施,为大规模、真实世界、临床相关的医疗 AI 研究提供了完整示范,也可用于追踪 AI 模型在获得监管批准后是否持续保持性能,例如获得 FDA 批准之后的表现。

MLCommons MedPerf 负责人 Alexandros Karargyris 表示,可信医疗 AI 面临的最大障碍之一,是真实世界数据需求与数据保护需求之间的张力。MedPerf 与 Google Cloud Confidential Space 的结合,为这一矛盾提供了可落地的解决方案,也体现了开放协作与生产级安全基础设施结合后能够释放的潜力。

加入 MedPerf 社区

MedPerf 是一个开源项目,由医疗 AI 社区围绕真实需求共同开发。在 MLCommons 社区贡献下,MedPerf 已支持多项有影响力的临床 AI 研究,包括面向脑肿瘤的 FeTS challenge 与 FeTS 2.0。

项目团队表示,MedPerf 仍有大量工作需要推进,也欢迎更多角色加入,包括:

  • 研究负责人:希望牵头全球临床 AI 研究的研究者。
  • 计算专家:希望基于真实世界医疗数据构建突破性 AI 的技术人员。
  • 基础设施工程师:致力于改进真实世界基准评测技术的工程团队。
  • 隐私与治理专家:为医疗数据访问控制和政策设计提供建议。
  • 监管专家:帮助真实世界基准评测更好地与监管要求对齐。

致谢

MedPerf confidential compute 集成背后有多方贡献,包括 Google Cloud 团队负责人 Nelly Porter、Indiana University School of Medicine 的 Dr. Spyridon Bakas、Northwestern University 的 Dr. Yury Velichko 等社区成员。该项目展示了医疗 AI 基准评测未来的一条重要路径:在不牺牲隐私、安全与知识产权的前提下,让模型接受更接近真实世界的检验。