PRISM2模型:临床对话赋能病理图像解读

近日,Paige与微软联合发布了基于临床对话的病理图像解读模型PRISM2。这一模型突破了传统病理AI仅止于像素分类的局限,通过语言生成的方式直接回答诊断问题,为AI在精准医疗中的应用树立了新的标杆。

技术解析:从图像走向语言

PRISM2采用了感知器(perceiver)架构,这是一种能够高效处理大规模多模态数据的编码器设计。在训练阶段,模型被同时暴露于组织切片图像(tissue tiles)以及从病理报告中提取的临床对话文本。通过对每张全玻片图像中数千个切片嵌入进行聚合,模型形成单一的全局表示,并依此生成自然语言回答。这种将图像与文本联合建模的方式,使模型不再只是输出一个标签,而是能够“解释”其判断。

病理报告中的描述性语言,例如“肿瘤细胞呈巢状排列,核异型性明显”,构成了模型的监督信号。通过注意力机制,PRISM2学习将这些文本与图像中的形态学特征对应起来。这意味着,当医生问“该切片的肿瘤分级如何?”时,模型不是简单检索数据库,而是根据图像内容动态生成回答。

传统卷积神经网络难以直接处理超高清的全玻片图像,而感知器架构通过将图像切块编码并线性聚合,大大降低了计算复杂度。这使PRISM2可以在单张GPU上处理整个切片,而无需牺牲全局上下文信息。

数据规模:230万张全玻片背后的底气

该模型的训练数据涵盖约230万张全玻片图像,规模在病理学AI领域属于最大级别之一。这些图像与相应的病理报告相结合,构建了图像-文本对。Paige拥有丰富的癌症组织数据积累,微软则提供世界级的大规模AI训练基础设施,两者的结合使PRISM2能够从海量数据中学习到高度泛化的特征。

行业背景:病理AI的变革时刻

全球范围内,病理医生资源严重不足,尤其是在发展中国家,大量癌症患者无法得到及时准确的诊断。AI辅助诊断被视为破局之道,但长期面临标注数据稀缺、可解释性差、跨实验室泛化难等瓶颈。PRISM2的意义在于,它利用病理报告中现成的临床语言作为监督信号,无需人工标注肿瘤区域,大幅降低了构建训练集的成本。

同时,大模型技术在医学影像领域的应用正在加速。此前,GPT-4V等通用多模态模型已展现出初步的医学图像理解能力,而PRISM2专注于病理学领域,是通用技术向垂直应用落地的案例。这种“专用医学大模型”有望在准确性和安全性上更贴合临床需求。

前景与隐患:智能诊断的下一步

PRISM2的应用潜力不仅限于辅助诊断,还延伸到医学教育、质量控制与科研探索。例如,检验科医生可以询问模型“该肿瘤边缘是否有浸润”,以获得即时回答,甚至让模型指出图像中的对应区域。然而,语言生成模型存在“幻觉”风险,即可能编造出并不存在的病理特征。因此,临床落地前必须经过严格的验证与监管审批,模型的公平性与偏见问题同样值得关注。

编者按:PRISM2的核心创新在于以临床对话为桥梁,让AI从“看”到“说”,再到“理解”。然而,医学AI的落地从不缺少挑战。技术的突破值得欢呼,而谨慎的临床评估才是AI走进医院大门的钥匙。

本文编译自AI News