通用细胞嵌入为细胞生物学提供基础模型

Universal cell embedding provides a foundation model for cell biology

作者信息Yanay Rosen, Yusuf Roohani, Ayush Agrawal, Leon Samotorčan, Tabula Sapiens Consortium, Stephen R Quake, Jure Leskovec
PMID42420460
期刊Nature
发布时间2026-08
DOI10.1038/s41586-026-10689-z

实验完整度

包含模型构建、大规模数据集训练、零样本嵌入验证、与现有方法比较、跨物种验证、下游任务案例研究等多个独立证据层级。

主要模型

单细胞转录组数据(scRNA-seq) 集成百万级图谱(IMA) Tabula Sapiens v.2数据集 绿猴淋巴结和肺细胞数据集

重点核对

UCE模型架构:33层transformer,超6.5亿参数,训练于超300个数据集、3600万个细胞,在24个A100 80GB GPU上训练40天 零样本嵌入测试:使用Tabula Sapiens v.2(581,430个细胞,27个组织,167个批次,162种细胞类型)评估UCE性能,并与Geneformer、scGPT等比较 跨物种泛化:对绿猴、裸鼹鼠、鸡等未见物种的细胞进行零样本嵌入,并通过最近质心匹配评估细胞类型对齐 Norn细胞案例分析:使用小鼠肾脏数据训练逻辑回归分类器,预测其他组织和疾病中的Norn样细胞,并用标记基因表达验证 评价指标:使用单细胞整合基准的指标,包括生物保守性和批次校正分数

摘要

开发一个涵盖物种间细胞类型巨大分子多样性的细胞通用表示空间,将对细胞生物学产生变革性影响。近年来,利用单细胞转录组方法以细胞图谱的形式创建细胞类型分子定义的工作,为此类尝试提供了必要的数据1–3。本文介绍了通用细胞嵌入(UCE)基础模型。UCE在大量细胞数据语料上通过自监督训练,创建了一个统一的生物潜空间,能够表示跨组织、跨物种的细胞。该潜空间在存在实验噪声的情况下仍能捕获重要的生物学变异。UCE的通用性意味着新细胞可以在无需数据标注、模型训练或微调的情况下进行嵌入。我们利用UCE构建了集成百万级图谱(IMA),嵌入了来自数百个实验、数十种组织和八个物种的超过3600万个细胞,包含1000多种唯一命名的细胞类型。我们深入了解了空间中细胞类型和组织的组织方式。UCE的嵌入空间表现出涌现行为,能够识别未经过训练的生物信息,例如识别发育谱系和嵌入训练集中未包含物种的数据。总之,通过对每种细胞状态和类型提供通用表示,UCE是单细胞数据分析、注释和假设生成的有价值工具。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
如何创建一个能够跨组织、跨物种地表示细胞类型的通用嵌入空间,并支持对新数据无需再训练的零样本分析?
核心机制
UCE通过将基因表达转换为基于蛋白质序列的嵌入,利用蛋白质语言模型(ESM2)和Transformer架构,学习细胞状态的通用表示,从而实现跨物种、跨数据集的泛化。
主要证据
在Tabula Sapiens v.2和多种未见物种数据集上,UCE零样本嵌入的细胞类型聚类和批次校正指标优于或匹配现有方法;Norn细胞案例分析展示了跨组织细胞类型识别。
研究意义
UCE为单细胞数据分析提供了通用工具,无需标注或微调即可进行细胞类型注释、跨数据集整合和假设生成,并可能有助于理解发育和疾病中的细胞状态。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

模型构建与训练

构建一个基于Transformer的自监督基础模型,学习细胞基因表达的通用表示。

UCE模型将单细胞基因表达转化为蛋白质序列嵌入,通过掩码基因预测任务进行训练,使用超300个数据集,3600万细胞。

2

构建集成百万级图谱(IMA)

验证UCE嵌入能自然组织细胞类型,并构建大规模参考图谱。

使用UCE对所有3600万个细胞进行嵌入,生成IMA,并通过UMAP可视化展示细胞类型聚类和批次混合。

3

零样本嵌入性能评估

评估UCE对新数据集(未在训练中见过)的零样本嵌入能力。

将UCE应用于Tabula Sapiens v.2数据集,并与Geneformer、scGPT、scVI、scArches等方法比较,使用单细胞整合基准的指标。

4

跨物种泛化验证

评估UCE对训练中未包含物种的细胞嵌入能力。

对绿猴、裸鼹鼠、鸡的细胞数据集进行零样本嵌入,并通过最近质心匹配评估细胞类型对齐。

5

Norn细胞跨组织分析与疾病关联

展示UCE在鉴定新细胞类型和跨组织、疾病状态分析中的应用。

使用小鼠肾脏Norn细胞训练分类器,在IMA中预测Norn样细胞,并在肺、心脏和疾病数据集(IPF、COPD)中分析其标记基因表达和疾病相关性。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
ESM2----
A100 80GB GPUNVIDIA--
Scanpy----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
UCE模型训练
模型超参数、训练数据组成、硬件配置、训练时长
阅读提示:Methods中的'Overview of UCE'、'Model training: cell representation'、'Model training: loss function'以及Supplementary Tables 2和16
零样本嵌入评估
评估数据集(Tabula Sapiens v.2)的细胞数量、组织、批次、细胞类型;比较方法(Geneformer、scGPT等)的版本和参数设置
阅读提示:Methods中的'Model Evaluation'、'Description of other models'以及Figure 2的图注
跨物种泛化验证
新物种数据集及其细胞类型注释;质心匹配的计算方式(最近邻数量)
阅读提示:Methods中的'Model Evaluation'以及Figure 2c,d的图注和Supplementary Table 15
Norn细胞分析
小鼠肾脏数据集的来源、分类器训练细节、差异表达分析的参数、疾病数据集(IPF/COPD)的样本量
阅读提示:Methods中的'Norn cell differential expression'以及Figure 4的图注