基准测试设计与数据集构建
评估基础模型在多种临床相关任务上的泛化能力。
收集了来自TCGA、CPTAC、DACHS、Kiel、Bern和IEO的13个队列共6818名患者、9528张切片,涵盖四种癌症类型,设计了31个弱监督任务,包括形态学、生物标志物和预后预测。
Benchmarking foundation models as feature extractors for weakly supervised computational pathology
包含多队列外部验证、多种任务(形态、生物标志物、预后)、多种模型比较及集成实验,并涉及注意力热图分析等功能验证。
19个组织病理学基础模型 TCGA等训练队列 CPTAC、DACHS、Kiel、Bern、IEO等外部验证队列 31个弱监督任务
外部验证数据集(CPTAC、DACHS、Kiel、Bern、IEO)与训练数据无重叠 下游模型训练样本量(75、150、300例)及低患病率任务(阳性率>15%) 输入切片预处理(224×224像素,约1.14μm/像素,Canny边缘检测去除背景) 特征聚合采用STAMP(transformer架构)与ABMIL比较 评估指标(AUROC、AUPRC、平衡准确率、F1分数、DeLong检验)
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
评估基础模型在多种临床相关任务上的泛化能力。
收集了来自TCGA、CPTAC、DACHS、Kiel、Bern和IEO的13个队列共6818名患者、9528张切片,涵盖四种癌症类型,设计了31个弱监督任务,包括形态学、生物标志物和预后预测。
利用基础模型提取组织病理切片的特征表示。
使用STAMP管道1.1.1版本,将WSI分割为224×224像素的tile,使用Canny边缘检测去除背景,无染色标准化,然后使用19个基础模型分别提取每个tile的特征向量,或使用滑动编码器编码的tile嵌入。
基于提取的特征训练分类器,评估模型性能。
使用TCGA数据集,将特征输入到基于Transformer的聚合器(STAMP)中进行训练,采用五折交叉验证,对每个任务、每个基础模型训练一个模型,并与ABMIL方法比较。
在外部队列上评估模型的泛化能力。
将在TCGA上训练好的模型应用于CPTAC、DACHS、Kiel、Bern和IEO等外部队列,计算AUROC、AUPRC、平衡准确率、F1分数等指标,并进行DeLong检验。
探讨基础模型在数据匮乏情况下的表现。
从TCGA中随机抽取75、150和300个患者子集,保持正样本比例,训练下游模型,并在完整外部队列上验证;另外,分析低患病率任务(阳性率>15%)的表现。
分析不同模型关注的组织区域和预测一致性。
计算模型间的Cohen's kappa,量化预测一致性;对选取的切片生成Grad-CAM注意力热图,比较模型关注的区域。
探究不同基础模型的集成是否能提升预测性能。
使用两种集成方法:(1)对不同基础模型的下游模型预测概率取平均;(2)拼接多个基础模型的特征向量,训练单一模型。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 计算环境 | NVIDIA RTX A6000 | NVIDIA | -- |
| NVIDIA L40 | NVIDIA | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据集选择 | 外部验证队列(CPTAC、DACHS、Kiel、Bern、IEO)与训练数据(TCGA)无重叠 阅读提示:Methods: Datasets |
| 切片预处理 | tile尺寸224×224像素,有效分辨率约1.14μm/像素;使用Canny边缘检测去除背景;未进行染色标准化 阅读提示:Methods: Image processing and deep learning techniques |
| 特征提取 | 基础模型选择(19个),tile嵌入维度(M=384至M=1536) 阅读提示:Methods: Image processing and deep learning techniques, Experimental design |
| 下游模型训练 | 聚合器架构(Transformer vs ABMIL),训练数据(TCGA),五折交叉验证 阅读提示:Methods: Image processing and deep learning techniques |
| 评估指标 | AUROC、AUPRC、平衡准确率、F1分数;DeLong检验(仅在二分类任务中) 阅读提示:Methods: Statistical analysis |
| 低数据场景 | 训练子集大小(75、150、300个患者),低患病率任务定义(阳性率>15%) 阅读提示:Results: Performance of foundation models in scarce data settings, Extended Data Fig. 5 |