具有临床对话能力的端到端多模态病理学基础模型

End-to-end multimodal pathology foundation model with clinical dialogue

作者信息Eugene Vorontsov, George Shaikovski, Adam Casson, Julian Viret, Eric Zimmermann, Neil Tenenholtz, Yi Kan Wang, Jan H Bernhard, Ran A Godrich, Juan A Retamero, Jinru Shia, Mithat Gonen, Martin R Weiser, David S Klimstra, Razik Yousfi, Nicolò Fusi, Thomas J Fuchs, Kristen Severson, Siqi Liu
PMID42538427
期刊Nat Med
发布时间2026-09
DOI10.1038/s41591-026-04521-4

实验完整度

高

基于230万张WSI和1400万问答对训练,包含多种下游临床任务验证:癌症检测、分型、生物标志物预测、生存预测及报告生成,且有消融实验与病理学家审核。

主要模型

685,507例标本的H&E全切片图像(WSI) 多种细胞系与组织芯片等下游任务评估数据集 PRISM2多模态基础模型(4.6亿参数) 生存预测微调模型

重点核对

PRISM2诊断嵌入在泛癌检测中AUC为0.967,优于PRISM(0.947)和TITAN(0.931) PRISM2基础嵌入在生物标志物预测中AUC为0.854(MSK)和0.784(TCGA),表现最佳 PRISM2生存嵌入在MSK CRC RFS中C-index为0.809,优于生存专家模型(0.773) PRISM2提示推理在前列腺、乳腺和BLN癌症检测中匹配或优于临床级产品Paige Prostate、Paige Breast和Paige BLN

摘要

计算病理学领域的快速进展得益于基础模型的发展。这些模型正开始从编码图像小块走向全切片理解,但其临床应用价值仍然有限。在此,我们提出 PRISM2,一个多模态切片级基础模型,基于 230 万张全切片图像和来自 70 万份病理报告的 1400 万个问答对训练而成。通过临床对话监督,PRISM2 将组织形态学与诊断推理对齐,产生既支持基于提示的推理又支持可迁移嵌入以用于下游任务的表征。在基于提示的推理中,PRISM2 在前列腺、乳腺和乳腺淋巴结癌检测方面达到或超过(P < 0.05)经校准的临床级产品的平衡准确率。此外,在全面的诊断、生物标志物和生存基准测试中,PRISM2 嵌入通过线性探测从未在统计上表现劣于先前的基础模型(P < 0.05)。此外,在生存预测上的任务特异性微调优于在相同大型生存数据集上从头训练。PRISM2 展示了语言监督预训练如何为可泛化的病理学表征提供可扩展、具有临床基础的信号,从而架起人类诊断推理与基础模型性能之间的桥梁。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
能否通过临床对话监督训练一个多模态切片级基础模型,使其在不进行任务特异性训练的情况下实现临床级癌症检测,并在多种下游病理学任务中具有泛化能力?
核心机制
PRISM2通过临床对话监督(包括报告生成、开放问答、是非问答和多选题问答)将组织形态学与诊断推理对齐,产生两种嵌入:用于诊断任务的诊断嵌入(来自语言模型隐藏状态)和用于泛化任务的基嵌入(来自注意力池化)。
主要证据
PRISM2在泛癌检测中诊断嵌入AUC为0.967,优于其他模型;在生物标志物预测中基嵌入表现最佳;在生存预测中生存嵌入C-index为0.809,优于生存专家模型;在前列腺、乳腺和BLN癌症检测中提示推理匹配或优于临床级产品。
研究意义
PRISM2展示了语言监督预训练为可泛化的病理学表征提供可扩展、具有临床基础的信号,架起了人类诊断推理与基础模型性能之间的桥梁,并首次实现了无需进一步训练的临床级癌症检测。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

训练数据准备与临床对话生成

构建大规模多模态训练数据集,生成用于监督学习的临床对话样本。

从685,507例标本的病理报告中,使用GPT-4o生成五类文本任务:报告生成、是非问答、开放问答、多选题问答和图像-文本匹配。同时挖掘补充性问答对以平衡数据分布。

2

PRISM2模型架构构建

设计能够同时处理图像和文本的多模态基础模型架构。

模型包含切片编码器(Perceiver架构,541M参数)、语言编码器(BioGPT)、LLM解码器(Phi-3 Mini,3.8B参数)和MLP适配器(29M参数)。切片编码器聚合Virchow2的切片嵌入,生成基嵌入;LLM解码器生成诊断嵌入。

3

两阶段训练

通过对比学习和自回归目标训练模型,使其对齐图像与文本,并具备对话能力。

第一阶段:更新切片编码器、注意力池化器、LLM适配器和BioGPT权重,冻结Phi-3 Mini。使用对比损失和对话损失。第二阶段:冻结切片编码器,更新LLM适配器和Phi-3 Mini权重,丢弃对比损失。

4

下游任务评估

评估PRISM2在癌症检测、分型、生物标志物预测和生存预测等任务上的性能。

使用提示推理、线性探测和微调等方法,在多个内部和公共数据集上进行评估,包括泛癌检测、前列腺癌、乳腺癌、BLN、TCGA子集、CAMELYON、PANDA、IMP-CRS等。

5

生存预测微调

优化模型在生存预测任务上的性能。

在包含225,597例病例(69,114死亡事件)的数据集上微调切片编码器,训练生存专用嵌入和Cox比例风险模型。

6

报告生成评估

评估模型直接完成病理报告的能力。

使用CAP乳腺浸润性癌活检报告模板,通过多选和是非问答填充九个字段,计算调整平均召回率(AMR)并评估校准效果。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
Leica扫描仪Leica--
Virchow2Paige.AI--
GPT-4oOpenAI--
GPT-4.1OpenAI--
Phi-3 MiniMicrosoft--
BioGPTMicrosoft--
PyTorchMeta--
PyTorch LightningLightning AI--
torchsurv----
scikit-learn----
Pandas----
OpenSlide----
Pillow----
nltk----
Python----
AdamW----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
多模态基础模型训练
训练数据规模:685,507例标本,2,350,518张WSI;对话样本:14百万问答对;两阶段训练策略:第一阶段冻结LLM,第二阶段冻结切片编码器;学习率和优化器配置:AdamW,β1=0.9,β2=0.95,第一阶段学习率1.0×10^-4(除语言编码器2.0×10^-5),第二阶段2.0×10^-5,预热500步;硬件:56块A100 40GB GPU,bf16精度。
阅读提示:Methods中'PRISM2 training'部分及'Optimization'小节。
下游任务线性探测评估
线性分类器训练:24个L2正则化权重,选择验证集最佳;生存分析:Cox模型,24个弹性网正则化权重(L1:L2=0.0001);评估指标:AUC、平衡准确率、C-index;统计检验:双尾置换检验,1000次置换,bootstrap 1000样本。
阅读提示:Methods中'Evaluation methods'部分及'Linear probe'小节。
提示推理评估
问答提示模板:是非问答和多选问答;概率计算:生成似然评分公式;校准方法:二元任务逐类阈值扫描,多类任务数值优化重加权;临床级产品阈值:产品特定阈值。
阅读提示:Methods中'Prompt-based inference with question answering'小节及'Report completion'部分。
生存预测微调
数据集:225,597例,69,114死亡事件;模型修改:新增交叉注意力池化和线性回归头;优化器:AdamW,β1=0.9,β2=0.98;学习率:切片编码器1.0×10^-4,预测头1.0×10^-3;预热4000步,权重衰减0.0001。
阅读提示:Methods中'Survival fine-tuning'小节。
报告生成评估
数据集:1,638例乳腺浸润性癌活检标本;报告模板:CAP乳腺活检浸润性癌方案;字段:组织学类型、组织学分级、DCIS、其他(淋巴血管侵犯和微钙化);评估指标:AMR,校准后最大AMR;排除字段:手术类型、侧别、肿瘤位置、核分裂率、肿瘤测量。
阅读提示:Methods中'Report completion'小节及'Evaluation datasets'部分。