构建多技术空间蛋白质组学数据语料
为训练和评估通用空间蛋白质组学基础模型提供多样化、跨平台的数据基础
收集并统一15个IMC队列,扩展至包含CODEX、Orion和MIBI的32个队列,涵盖多种器官来源和marker panel;过滤低质量图像并生成组织分割掩码
The Virtual Tissues foundation model resolves spatial proteomics across scales
含15个IMC队列及多技术数据集,含体外细胞分型、分割、标志物重建、小鼠/患者样本生存分析与独立队列验证,具备功能与机制验证
15个IMC队列(8个器官部位,3102例患者,146个标志物) 三阴性乳腺癌NeoTRIP队列(138例,含治疗前/中/后活检) METABRIC乳腺癌ER+队列(541例组织图像) 独立TNBC队列Meyer et al.(用于无病生存验证)
VirTues在15个IMC数据集上预训练,训练/测试按80/20划分并保证患者不跨集 三种掩码重建策略(独立掩码、标志物掩码、niche掩码)的Pearson相关系数 零样本评估采用留一数据集法,分别排除Cords、Hoch、Danenberg、Wang等队列 NeoTRIP队列中治疗前、治疗中和治疗后样本的病理完全缓解预测AUROC与交叉验证 独立TNBC队列中基于signature频率的无病生存Kaplan-Meier分层与concordance index
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
为训练和评估通用空间蛋白质组学基础模型提供多样化、跨平台的数据基础
收集并统一15个IMC队列,扩展至包含CODEX、Orion和MIBI的32个队列,涵盖多种器官来源和marker panel;过滤低质量图像并生成组织分割掩码
通过自监督学习从多重成像数据中获取跨尺度、marker感知的虚拟组织表征
采用masked autoencoding目标,结合ESM-2 marker token与图像token,使用交替的marker注意力和空间注意力以及patch summary token,训练编码器-解码器重建被mask的marker-space张量
验证模型对组织结构和marker相互关系的理解
在独立掩码、marker掩码和niche掩码三种策略下测试重建性能,评估Pearson相关系数并与均值强度和最优相关marker基线比较;在留出数据集上进行零样本重建
验证模型在单细胞尺度上的表征质量和跨队列泛化能力
使用cell summary token进行逻辑回归线性探针细胞分型,并与KRONOS和CA-MAE比较;在VirTues patch表征上训练U-Net风格分割模块,联合预测实例掩码和语义细胞类型掩码,进行留一队列的零样本分割和分型评估
测试VirTues表征能否捕获与患者生存相关的多细胞组织结构和临床诊断信息
在METABRIC ER+乳腺癌队列中,将cell token聚类为120个表型状态,计算每例患者的表型组成指纹并进行k-means聚类,通过Kaplan-Meier和log-rank检验分层生存;使用ABMIL聚合patch token进行癌症亚型、分级、ERBB2、ER状态和PAM50等组织水平分类
从治疗前活检中无假设地发现能预测抗PD-L1化疗-免疫治疗反应并在独立队列中分层生存的空间生物标志物
在NeoTRIP TNBC治疗前样本中,对cell summary token进行多分辨率Leiden聚类,计算每例患者的cluster频率,通过交叉验证的logistic回归筛选response和non-response signature;构建多变量模型预测病理完全缓解;将signature转移到独立TNBC队列Meyer et al.,使用随机森林分类器预测细胞归属并计算风险评分进行无病生存分析
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 预训练与数据分析 | PyTorch | -- | v.2.5.1 |
| Flash Attention-2 | -- | v.2.7.4 | |
| 数据分析与统计 | NumPy | -- | v.2.2.4 |
| zarr | -- | v.3.1.5 | |
| pandas | -- | v.2.2.3 | |
| 数据分析与可视化 | matplotlib | -- | v.3.10.3 |
| seaborn | -- | v.0.13.2 | |
| 蛋白质嵌入计算 | fair-esm | -- | v.2.0.0 |
| 图像处理 | scikit-image | -- | v.0.25.2 |
| 机器学习与统计分析 | scikit-learn | -- | v.1.5.2 |
| 生存分析 | scikit-survival | -- | v.0.24.1 |
| lifelines | -- | v.0.30.0 | |
| 聚类分析 | cuML | -- | v.25.8.0 |
| 细胞分割 | instanseg-torch | -- | v.0.1.1 |
| 图像可视化 | napari | -- | v.0.5.5 |
| 图像配准 | wsireg | -- | v.0.3.10 |
| 图像分析与标注 | QuPath | -- | v.0.5.1 |
| 预训练计算硬件 | NVIDIA GH200 GPU | NVIDIA | -- |
| 下游实验计算硬件 | NVIDIA A100 80 GB GPU | NVIDIA | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| VirTues预训练 | 输入crop大小128×128、patch大小8×8、掩码比例60%–100%、marker dropout比例0–25%、训练150个epoch、AdamW优化器、有效batch size 512、学习率0.0002、权重衰减0.04余弦调度、梯度裁剪最大范数1.0、16-bit混合精度 阅读提示:查阅Methods中'VirTues pretraining'和'Optimization'小节 |
| 数据集划分与预处理 | 每个预训练数据集按80/20划分且保证患者不跨训练/测试集;强度按通道99百分位截断后进行shifted logarithm变换和通道标准化;预处理统计仅基于组织区域;高斯模糊核大小3单位方差 阅读提示:查阅Methods中'Dataset curation'和'Dataset preprocessing'小节 |
| masked重建评估 | 三种掩码策略的掩码比例、评估仅基于被掩码token像素、独立掩码和niche掩码使用可见像素均值作为基线、marker掩码使用最相关marker作为基线;零样本评估排除Rigamonti et al.数据集 阅读提示:查阅Methods中'Masked reconstructions'小节及Fig. 2图注 |
| 细胞分型与分割评估 | 线性探针使用L-BGFS求解器和L2正则化系数λ=1.0;细胞标签来自原始研究,Danenberg等合并为8类,Wang等定义6个高水平和19个低水平类别;分割模块训练100个epoch、AdamW、有效batch size 64、学习率0.001;零样本分割采用留一队列评估 阅读提示:查阅Methods中'Cell-level benchmarks'和'Cross-cohort cell segmentation and cell typing'小节 |
| TME风险分层与组织水平分类 | METABRIC ER+患者n=541;cell summary token通过k-means分为120个聚类;ABMIL使用8个head、hidden dimension 256、Adam优化器、学习率10^-4、batch size 16、最大100个epoch、patience 10;性能报告为5次随机种子的macro-F1平均值 阅读提示:查阅Methods中'Tissue structure-based risk stratification'和'Tissue-level classification'小节及Fig. 4图注 |
| 预测治疗反应的生物标志物发现与转移验证 | 发现队列为NeoTRIP per-protocol患者n=111;Leiden分辨率范围4–5步长0.05,仅保留少于2000细胞的cluster;cluster比例离散为4个等级;采用分层四折交叉验证重复10次;多变量模型使用100次随机75–25%分层划分;转移验证随机森林200棵树、Gini分裂、最大深度16、20%验证集;风险评分分组阈值R>2为高风险、-1≤R≤2为中风险、R<-1为低风险 阅读提示:查阅Methods中'Identification of foundation model-based biomarkers predictive of therapy response'和'Cross-cohort generalization of VirTues-derived spatial biomarkers'小节及Fig. 5图注 |