模型构建与训练
构建一个基于Transformer的自监督基础模型,学习细胞基因表达的通用表示。
UCE模型将单细胞基因表达转化为蛋白质序列嵌入,通过掩码基因预测任务进行训练,使用超300个数据集,3600万细胞。
Universal cell embedding provides a foundation model for cell biology
包含模型构建、大规模数据集训练、零样本嵌入验证、与现有方法比较、跨物种验证、下游任务案例研究等多个独立证据层级。
单细胞转录组数据(scRNA-seq) 集成百万级图谱(IMA) Tabula Sapiens v.2数据集 绿猴淋巴结和肺细胞数据集
UCE模型架构:33层transformer,超6.5亿参数,训练于超300个数据集、3600万个细胞,在24个A100 80GB GPU上训练40天 零样本嵌入测试:使用Tabula Sapiens v.2(581,430个细胞,27个组织,167个批次,162种细胞类型)评估UCE性能,并与Geneformer、scGPT等比较 跨物种泛化:对绿猴、裸鼹鼠、鸡等未见物种的细胞进行零样本嵌入,并通过最近质心匹配评估细胞类型对齐 Norn细胞案例分析:使用小鼠肾脏数据训练逻辑回归分类器,预测其他组织和疾病中的Norn样细胞,并用标记基因表达验证 评价指标:使用单细胞整合基准的指标,包括生物保守性和批次校正分数
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
构建一个基于Transformer的自监督基础模型,学习细胞基因表达的通用表示。
UCE模型将单细胞基因表达转化为蛋白质序列嵌入,通过掩码基因预测任务进行训练,使用超300个数据集,3600万细胞。
验证UCE嵌入能自然组织细胞类型,并构建大规模参考图谱。
使用UCE对所有3600万个细胞进行嵌入,生成IMA,并通过UMAP可视化展示细胞类型聚类和批次混合。
评估UCE对新数据集(未在训练中见过)的零样本嵌入能力。
将UCE应用于Tabula Sapiens v.2数据集,并与Geneformer、scGPT、scVI、scArches等方法比较,使用单细胞整合基准的指标。
评估UCE对训练中未包含物种的细胞嵌入能力。
对绿猴、裸鼹鼠、鸡的细胞数据集进行零样本嵌入,并通过最近质心匹配评估细胞类型对齐。
展示UCE在鉴定新细胞类型和跨组织、疾病状态分析中的应用。
使用小鼠肾脏Norn细胞训练分类器,在IMA中预测Norn样细胞,并在肺、心脏和疾病数据集(IPF、COPD)中分析其标记基因表达和疾病相关性。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 模型训练 | ESM2 | -- | -- |
| A100 80GB GPU | NVIDIA | -- | |
| 数据分析 | Scanpy | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| UCE模型训练 | 模型超参数、训练数据组成、硬件配置、训练时长 阅读提示:Methods中的'Overview of UCE'、'Model training: cell representation'、'Model training: loss function'以及Supplementary Tables 2和16 |
| 零样本嵌入评估 | 评估数据集(Tabula Sapiens v.2)的细胞数量、组织、批次、细胞类型;比较方法(Geneformer、scGPT等)的版本和参数设置 阅读提示:Methods中的'Model Evaluation'、'Description of other models'以及Figure 2的图注 |
| 跨物种泛化验证 | 新物种数据集及其细胞类型注释;质心匹配的计算方式(最近邻数量) 阅读提示:Methods中的'Model Evaluation'以及Figure 2c,d的图注和Supplementary Table 15 |
| Norn细胞分析 | 小鼠肾脏数据集的来源、分类器训练细节、差异表达分析的参数、疾病数据集(IPF/COPD)的样本量 阅读提示:Methods中的'Norn cell differential expression'以及Figure 4的图注 |