将基础模型作为弱监督计算病理学特征提取器的基准测试

Benchmarking foundation models as feature extractors for weakly supervised computational pathology

作者信息Peter Neidlinger, Omar S M El Nahhas, Hannah Sophie Muti, Tim Lenz, Michael Hoffmeister, Hermann Brenner, Marko van Treeck, Rupert Langer, Bastian Dislich, Hans Michael Behrens, Christoph Röcken, Sebastian Foersch, Daniel Truhn, Antonio Marra, Oliver Lester Saldanha, Jakob Nikolas Kather
PMID41034516
发布时间2026-06
DOI10.1038/s41551-025-01516-3

实验完整度

包含多队列外部验证、多种任务(形态、生物标志物、预后)、多种模型比较及集成实验,并涉及注意力热图分析等功能验证。

主要模型

19个组织病理学基础模型 TCGA等训练队列 CPTAC、DACHS、Kiel、Bern、IEO等外部验证队列 31个弱监督任务

重点核对

外部验证数据集(CPTAC、DACHS、Kiel、Bern、IEO)与训练数据无重叠 下游模型训练样本量(75、150、300例)及低患病率任务(阳性率>15%) 输入切片预处理(224×224像素,约1.14μm/像素,Canny边缘检测去除背景) 特征聚合采用STAMP(transformer架构)与ABMIL比较 评估指标(AUROC、AUPRC、平衡准确率、F1分数、DeLong检验)

摘要

众多病理学基础模型已被开发出来用于提取临床相关信息。目前,在外部队列和临床相关任务上独立评估这些基础模型的文献有限,无法发现未来改进的调整方向。在此,我们对13个患者队列中的19个组织病理学基础模型进行了基准测试,这些队列包含来自肺癌、结直肠癌、胃癌和乳腺癌的6818名患者和9528张切片。这些模型在涉及生物标志物、形态学特征和预后结果的弱监督任务上进行了评估。我们发现,一种视觉-语言基础模型CONCH在整体性能上优于纯视觉基础模型,Virchow2紧随其后,尽管其优异性能在低数据场景和低患病率任务中不太明显。实验表明,在不同队列上训练的基础模型学习到互补的特征来预测同一标签,并且可以融合以超越当前最先进水平。结合CONCH和Virchow2预测的集成模型在55%的任务中优于单个模型,利用了它们在分类场景中的互补优势。此外,我们的研究结果表明,数据多样性比数据量对基础模型更重要。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
在外部真实队列上,19个组织病理学基础模型在形态学、生物标志物和预后预测等弱监督任务中的表现如何?
核心机制
模型在预训练数据中的组织类型多样性和分布(而非单纯数据量)是下游性能的关键决定因素。
主要证据
在31项任务中,视觉-语言模型CONCH平均AUROC最高(0.71),与Virchow2(0.71)并列;CONCH在低数据场景和低患病率任务中优势减弱;整合CONCH和Virchow2预测的集成模型在55%任务中优于单个模型。
研究意义
提出了基础模型在不同任务和低数据场景下的性能表现,以及模型集成提升性能的可能性,为计算病理学中基础模型的选择和发展提供了参考。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

基准测试设计与数据集构建

评估基础模型在多种临床相关任务上的泛化能力。

收集了来自TCGA、CPTAC、DACHS、Kiel、Bern和IEO的13个队列共6818名患者、9528张切片,涵盖四种癌症类型,设计了31个弱监督任务,包括形态学、生物标志物和预后预测。

2

WSI预处理与特征提取

利用基础模型提取组织病理切片的特征表示。

使用STAMP管道1.1.1版本,将WSI分割为224×224像素的tile,使用Canny边缘检测去除背景,无染色标准化,然后使用19个基础模型分别提取每个tile的特征向量,或使用滑动编码器编码的tile嵌入。

3

下游模型训练与五折交叉验证

基于提取的特征训练分类器,评估模型性能。

使用TCGA数据集,将特征输入到基于Transformer的聚合器(STAMP)中进行训练,采用五折交叉验证,对每个任务、每个基础模型训练一个模型,并与ABMIL方法比较。

4

外部验证与性能评估

在外部队列上评估模型的泛化能力。

将在TCGA上训练好的模型应用于CPTAC、DACHS、Kiel、Bern和IEO等外部队列,计算AUROC、AUPRC、平衡准确率、F1分数等指标,并进行DeLong检验。

5

低数据场景评估

探讨基础模型在数据匮乏情况下的表现。

从TCGA中随机抽取75、150和300个患者子集,保持正样本比例,训练下游模型,并在完整外部队列上验证;另外,分析低患病率任务(阳性率>15%)的表现。

6

预测相似性与注意力分析

分析不同模型关注的组织区域和预测一致性。

计算模型间的Cohen's kappa,量化预测一致性;对选取的切片生成Grad-CAM注意力热图,比较模型关注的区域。

7

集成模型构建

探究不同基础模型的集成是否能提升预测性能。

使用两种集成方法:(1)对不同基础模型的下游模型预测概率取平均;(2)拼接多个基础模型的特征向量,训练单一模型。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
NVIDIA RTX A6000NVIDIA--
NVIDIA L40NVIDIA--

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据集选择
外部验证队列(CPTAC、DACHS、Kiel、Bern、IEO)与训练数据(TCGA)无重叠
阅读提示:Methods: Datasets
切片预处理
tile尺寸224×224像素,有效分辨率约1.14μm/像素;使用Canny边缘检测去除背景;未进行染色标准化
阅读提示:Methods: Image processing and deep learning techniques
特征提取
基础模型选择(19个),tile嵌入维度(M=384至M=1536)
阅读提示:Methods: Image processing and deep learning techniques, Experimental design
下游模型训练
聚合器架构(Transformer vs ABMIL),训练数据(TCGA),五折交叉验证
阅读提示:Methods: Image processing and deep learning techniques
评估指标
AUROC、AUPRC、平衡准确率、F1分数;DeLong检验(仅在二分类任务中)
阅读提示:Methods: Statistical analysis
低数据场景
训练子集大小(75、150、300个患者),低患病率任务定义(阳性率>15%)
阅读提示:Results: Performance of foundation models in scarce data settings, Extended Data Fig. 5