训练数据准备与临床对话生成
构建大规模多模态训练数据集,生成用于监督学习的临床对话样本。
从685,507例标本的病理报告中,使用GPT-4o生成五类文本任务:报告生成、是非问答、开放问答、多选题问答和图像-文本匹配。同时挖掘补充性问答对以平衡数据分布。
End-to-end multimodal pathology foundation model with clinical dialogue
基于230万张WSI和1400万问答对训练,包含多种下游临床任务验证:癌症检测、分型、生物标志物预测、生存预测及报告生成,且有消融实验与病理学家审核。
685,507例标本的H&E全切片图像(WSI) 多种细胞系与组织芯片等下游任务评估数据集 PRISM2多模态基础模型(4.6亿参数) 生存预测微调模型
PRISM2诊断嵌入在泛癌检测中AUC为0.967,优于PRISM(0.947)和TITAN(0.931) PRISM2基础嵌入在生物标志物预测中AUC为0.854(MSK)和0.784(TCGA),表现最佳 PRISM2生存嵌入在MSK CRC RFS中C-index为0.809,优于生存专家模型(0.773) PRISM2提示推理在前列腺、乳腺和BLN癌症检测中匹配或优于临床级产品Paige Prostate、Paige Breast和Paige BLN
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
构建大规模多模态训练数据集,生成用于监督学习的临床对话样本。
从685,507例标本的病理报告中,使用GPT-4o生成五类文本任务:报告生成、是非问答、开放问答、多选题问答和图像-文本匹配。同时挖掘补充性问答对以平衡数据分布。
设计能够同时处理图像和文本的多模态基础模型架构。
模型包含切片编码器(Perceiver架构,541M参数)、语言编码器(BioGPT)、LLM解码器(Phi-3 Mini,3.8B参数)和MLP适配器(29M参数)。切片编码器聚合Virchow2的切片嵌入,生成基嵌入;LLM解码器生成诊断嵌入。
通过对比学习和自回归目标训练模型,使其对齐图像与文本,并具备对话能力。
第一阶段:更新切片编码器、注意力池化器、LLM适配器和BioGPT权重,冻结Phi-3 Mini。使用对比损失和对话损失。第二阶段:冻结切片编码器,更新LLM适配器和Phi-3 Mini权重,丢弃对比损失。
评估PRISM2在癌症检测、分型、生物标志物预测和生存预测等任务上的性能。
使用提示推理、线性探测和微调等方法,在多个内部和公共数据集上进行评估,包括泛癌检测、前列腺癌、乳腺癌、BLN、TCGA子集、CAMELYON、PANDA、IMP-CRS等。
优化模型在生存预测任务上的性能。
在包含225,597例病例(69,114死亡事件)的数据集上微调切片编码器,训练生存专用嵌入和Cox比例风险模型。
评估模型直接完成病理报告的能力。
使用CAP乳腺浸润性癌活检报告模板,通过多选和是非问答填充九个字段,计算调整平均召回率(AMR)并评估校准效果。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 全切片图像扫描 | Leica扫描仪 | Leica | -- |
| 图像处理与特征提取 | Virchow2 | Paige.AI | -- |
| 文本生成与对话生成 | GPT-4o | OpenAI | -- |
| GPT-4.1 | OpenAI | -- | |
| 模型训练 | Phi-3 Mini | Microsoft | -- |
| BioGPT | Microsoft | -- | |
| 深度学习框架 | PyTorch | Meta | -- |
| PyTorch Lightning | Lightning AI | -- | |
| 生存分析 | torchsurv | -- | -- |
| 数据分析 | scikit-learn | -- | -- |
| 数据处理 | Pandas | -- | -- |
| 图像处理 | OpenSlide | -- | -- |
| Pillow | -- | -- | |
| 自然语言处理 | nltk | -- | -- |
| 编程 | Python | -- | -- |
| 模型训练 | AdamW | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 多模态基础模型训练 | 训练数据规模:685,507例标本,2,350,518张WSI;对话样本:14百万问答对;两阶段训练策略:第一阶段冻结LLM,第二阶段冻结切片编码器;学习率和优化器配置:AdamW,β1=0.9,β2=0.95,第一阶段学习率1.0×10^-4(除语言编码器2.0×10^-5),第二阶段2.0×10^-5,预热500步;硬件:56块A100 40GB GPU,bf16精度。 阅读提示:Methods中'PRISM2 training'部分及'Optimization'小节。 |
| 下游任务线性探测评估 | 线性分类器训练:24个L2正则化权重,选择验证集最佳;生存分析:Cox模型,24个弹性网正则化权重(L1:L2=0.0001);评估指标:AUC、平衡准确率、C-index;统计检验:双尾置换检验,1000次置换,bootstrap 1000样本。 阅读提示:Methods中'Evaluation methods'部分及'Linear probe'小节。 |
| 提示推理评估 | 问答提示模板:是非问答和多选问答;概率计算:生成似然评分公式;校准方法:二元任务逐类阈值扫描,多类任务数值优化重加权;临床级产品阈值:产品特定阈值。 阅读提示:Methods中'Prompt-based inference with question answering'小节及'Report completion'部分。 |
| 生存预测微调 | 数据集:225,597例,69,114死亡事件;模型修改:新增交叉注意力池化和线性回归头;优化器:AdamW,β1=0.9,β2=0.98;学习率:切片编码器1.0×10^-4,预测头1.0×10^-3;预热4000步,权重衰减0.0001。 阅读提示:Methods中'Survival fine-tuning'小节。 |
| 报告生成评估 | 数据集:1,638例乳腺浸润性癌活检标本;报告模板:CAP乳腺活检浸润性癌方案;字段:组织学类型、组织学分级、DCIS、其他(淋巴血管侵犯和微钙化);评估指标:AMR,校准后最大AMR;排除字段:手术类型、侧别、肿瘤位置、核分裂率、肿瘤测量。 阅读提示:Methods中'Report completion'小节及'Evaluation datasets'部分。 |