虚拟组织基础模型在跨尺度空间蛋白质组学中的应用

The Virtual Tissues foundation model resolves spatial proteomics across scales

作者信息Johann Wenckstern, Eeshaan Jain, Benedikt von Querfurth, Yexiang Cheng, Kiril Vasilev, Matteo Pariset, Phil F Cheng, Petros Liakopoulos, Olivier Michielin, Andreas Wicki, Gabriele Gut, Charlotte Bunne
PMID42557331
期刊Nature
发布时间2026-09
DOI10.1038/s41586-026-10884-y

实验完整度

高

含15个IMC队列及多技术数据集,含体外细胞分型、分割、标志物重建、小鼠/患者样本生存分析与独立队列验证,具备功能与机制验证

主要模型

15个IMC队列(8个器官部位,3102例患者,146个标志物) 三阴性乳腺癌NeoTRIP队列(138例,含治疗前/中/后活检) METABRIC乳腺癌ER+队列(541例组织图像) 独立TNBC队列Meyer et al.(用于无病生存验证)

重点核对

VirTues在15个IMC数据集上预训练,训练/测试按80/20划分并保证患者不跨集 三种掩码重建策略(独立掩码、标志物掩码、niche掩码)的Pearson相关系数 零样本评估采用留一数据集法,分别排除Cords、Hoch、Danenberg、Wang等队列 NeoTRIP队列中治疗前、治疗中和治疗后样本的病理完全缓解预测AUROC与交叉验证 独立TNBC队列中基于signature频率的无病生存Kaplan-Meier分层与concordance index

摘要

空间蛋白质组学技术已经改变了我们对癌症中复杂组织结构理解的能力,但给计算分析带来了独特的挑战。每项研究使用不同的标志物panel和实验方案,且大多数方法针对单一队列定制,这限制了知识的迁移和稳健的生物标志物发现。在此,我们提出虚拟组织(Virtual Tissues,VirTues),一个用于空间蛋白质组学的通用基础模型,能够直接从多重成像数据中学习标志物感知、多尺度的蛋白质、细胞、niche和组织表征。基于单个预训练主干,VirTues支持标志物重建、细胞分割和分型、niche注释、空间生物标志物发现和患者分层,包括跨异质panel和数据集的零样本注释。在三阴性乳腺癌中,VirTues衍生的生物标志物可预测抗PD-L1化疗-免疫治疗反应,并在独立队列中对无病生存进行分层,优于从相同数据集衍生出的最先进生物标志物和当前临床分层方案。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
如何构建一个通用基础模型,能够跨异质marker panel、平台和队列直接处理高多重空间蛋白质组学数据,并用于生物标志物发现和临床预测?
核心机制
VirTues利用蛋白质语言模型(ESM-2)嵌入编码marker身份,结合分解的marker注意力和空间注意力以及多尺度summary token,将异质panel映射到共享的虚拟组织空间,从而支持零样本迁移、细胞分割和分型、niche注释以及多细胞空间生物标志物发现。
主要证据
在15个IMC队列和扩展的多技术语料(32个队列,超过5100例患者,239个marker)上,VirTues在masked marker重建、跨队列细胞分型和分割、组织水平分类和临床特征检索中优于KRONOS、CA-MAE和ResNet等基线;在NeoTRIP TNBC队列中,从治疗前活检自动发现的response signature达到AUROC 0.823,超过Wang等人的空间预测因子;这些signature转移到独立TNBC队列后可分层无病生存(log-rank P=0.0037,concordance index 0.628)。
研究意义
VirTues为空间蛋白质组学提供了一个可复用的计算层,将异质队列统一为可查询的虚拟组织图谱,并支持从多细胞空间组织自动发现具有临床可解释性的生物标志物,推动空间蛋白质组学从孤立研究走向图谱规模的系统化诊断和预后分析。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

构建多技术空间蛋白质组学数据语料

为训练和评估通用空间蛋白质组学基础模型提供多样化、跨平台的数据基础

收集并统一15个IMC队列,扩展至包含CODEX、Orion和MIBI的32个队列,涵盖多种器官来源和marker panel;过滤低质量图像并生成组织分割掩码

2

预训练VirTues基础模型

通过自监督学习从多重成像数据中获取跨尺度、marker感知的虚拟组织表征

采用masked autoencoding目标,结合ESM-2 marker token与图像token,使用交替的marker注意力和空间注意力以及patch summary token,训练编码器-解码器重建被mask的marker-space张量

3

评估masked marker重建能力

验证模型对组织结构和marker相互关系的理解

在独立掩码、marker掩码和niche掩码三种策略下测试重建性能,评估Pearson相关系数并与均值强度和最优相关marker基线比较;在留出数据集上进行零样本重建

4

细胞分型和跨队列细胞分割

验证模型在单细胞尺度上的表征质量和跨队列泛化能力

使用cell summary token进行逻辑回归线性探针细胞分型,并与KRONOS和CA-MAE比较;在VirTues patch表征上训练U-Net风格分割模块,联合预测实例掩码和语义细胞类型掩码,进行留一队列的零样本分割和分型评估

5

TME结构风险分层与组织水平临床预测

测试VirTues表征能否捕获与患者生存相关的多细胞组织结构和临床诊断信息

在METABRIC ER+乳腺癌队列中,将cell token聚类为120个表型状态,计算每例患者的表型组成指纹并进行k-means聚类,通过Kaplan-Meier和log-rank检验分层生存;使用ABMIL聚合patch token进行癌症亚型、分级、ERBB2、ER状态和PAM50等组织水平分类

6

发现并验证预测治疗反应的VirTues生物标志物

从治疗前活检中无假设地发现能预测抗PD-L1化疗-免疫治疗反应并在独立队列中分层生存的空间生物标志物

在NeoTRIP TNBC治疗前样本中,对cell summary token进行多分辨率Leiden聚类,计算每例患者的cluster频率,通过交叉验证的logistic回归筛选response和non-response signature;构建多变量模型预测病理完全缓解;将signature转移到独立TNBC队列Meyer et al.,使用随机森林分类器预测细胞归属并计算风险评分进行无病生存分析

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
PyTorch--v.2.5.1
Flash Attention-2--v.2.7.4
NumPy--v.2.2.4
zarr--v.3.1.5
pandas--v.2.2.3
matplotlib--v.3.10.3
seaborn--v.0.13.2
fair-esm--v.2.0.0
scikit-image--v.0.25.2
scikit-learn--v.1.5.2
scikit-survival--v.0.24.1
lifelines--v.0.30.0
cuML--v.25.8.0
instanseg-torch--v.0.1.1
napari--v.0.5.5
wsireg--v.0.3.10
QuPath--v.0.5.1
NVIDIA GH200 GPUNVIDIA--
NVIDIA A100 80 GB GPUNVIDIA--

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
VirTues预训练
输入crop大小128×128、patch大小8×8、掩码比例60%–100%、marker dropout比例0–25%、训练150个epoch、AdamW优化器、有效batch size 512、学习率0.0002、权重衰减0.04余弦调度、梯度裁剪最大范数1.0、16-bit混合精度
阅读提示:查阅Methods中'VirTues pretraining'和'Optimization'小节
数据集划分与预处理
每个预训练数据集按80/20划分且保证患者不跨训练/测试集;强度按通道99百分位截断后进行shifted logarithm变换和通道标准化;预处理统计仅基于组织区域;高斯模糊核大小3单位方差
阅读提示:查阅Methods中'Dataset curation'和'Dataset preprocessing'小节
masked重建评估
三种掩码策略的掩码比例、评估仅基于被掩码token像素、独立掩码和niche掩码使用可见像素均值作为基线、marker掩码使用最相关marker作为基线;零样本评估排除Rigamonti et al.数据集
阅读提示:查阅Methods中'Masked reconstructions'小节及Fig. 2图注
细胞分型与分割评估
线性探针使用L-BGFS求解器和L2正则化系数λ=1.0;细胞标签来自原始研究,Danenberg等合并为8类,Wang等定义6个高水平和19个低水平类别;分割模块训练100个epoch、AdamW、有效batch size 64、学习率0.001;零样本分割采用留一队列评估
阅读提示:查阅Methods中'Cell-level benchmarks'和'Cross-cohort cell segmentation and cell typing'小节
TME风险分层与组织水平分类
METABRIC ER+患者n=541;cell summary token通过k-means分为120个聚类;ABMIL使用8个head、hidden dimension 256、Adam优化器、学习率10^-4、batch size 16、最大100个epoch、patience 10;性能报告为5次随机种子的macro-F1平均值
阅读提示:查阅Methods中'Tissue structure-based risk stratification'和'Tissue-level classification'小节及Fig. 4图注
预测治疗反应的生物标志物发现与转移验证
发现队列为NeoTRIP per-protocol患者n=111;Leiden分辨率范围4–5步长0.05,仅保留少于2000细胞的cluster;cluster比例离散为4个等级;采用分层四折交叉验证重复10次;多变量模型使用100次随机75–25%分层划分;转移验证随机森林200棵树、Gini分裂、最大深度16、20%验证集;风险评分分组阈值R>2为高风险、-1≤R≤2为中风险、R<-1为低风险
阅读提示:查阅Methods中'Identification of foundation model-based biomarkers predictive of therapy response'和'Cross-cohort generalization of VirTues-derived spatial biomarkers'小节及Fig. 5图注