数据整合和批量校正
评估不同批量校正方法对整合多个单核RNA测序数据集的性能,并选择最优方法以构建一致的图谱。
收集九个已发表和未发表的snRNA-seq数据集,统一预处理(包括使用CellRanger、CellBender、Scrublet等工具),使用scIB评估四种批量校正方法(Harmony、Scanorama、scVI、scANVI)的16种参数组合,最终选择scANVI进行全图谱整合。
An integrated cell atlas of 2.4 million cardiac cells across 209 individuals in health and disease
整合多个snRNA-seq数据集并进行批量校正,包含体外细胞图谱、患者样本、体内RNAscope验证等,且包含多种疾病状态和细胞类型的功能验证。
成人心脏组织样本(包括左心室、右心室、心尖、室间隔等区域) 患者来源的心脏组织(包括扩张型心肌病、肥厚型心肌病、缺血性心肌病、致心律失常性右心室心肌病、急性心肌梗死、冠心病心力衰竭等) 非衰竭对照心脏组织
研究的个体总数:209名(中位年龄54岁,39%女性) 整合方法:scANVI,使用25个潜在变量,基于个体协变量 包含的细胞核总数:2,479,674个 样本类型:九个数据集,涵盖485个心脏样本和多个解剖区域 差异表达分析模型:Expr ~ 0 + disease + study + anatomy + sex,使用limma-voom和duplicateCorrelation RNAscope验证:用于验证COL22A1和TNC标记的活化成纤维细胞群体,使用POSTN标记
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
评估不同批量校正方法对整合多个单核RNA测序数据集的性能,并选择最优方法以构建一致的图谱。
收集九个已发表和未发表的snRNA-seq数据集,统一预处理(包括使用CellRanger、CellBender、Scrublet等工具),使用scIB评估四种批量校正方法(Harmony、Scanorama、scVI、scANVI)的16种参数组合,最终选择scANVI进行全图谱整合。
识别心脏组织中的主要细胞类型及其亚型,并表征其转录特征。
使用Leiden聚类(分辨率2.0)进行全局聚类,基于典型标记基因注释14种细胞类型;在每种细胞类型内进一步亚聚类(分辨率0.1-2.0),以识别潜在的亚型。
比较不同疾病状态与对照以及疾病之间的转录差异,并识别跨研究一致的疾病相关基因。
使用limma-voom模型进行细胞类型层面的伪bulk差异表达分析,模型包含疾病、研究、解剖和性别,并控制个体效应。针对扩张型心肌病,在三个独立研究中进行单独的差异表达分析,并使用I2统计量评估异质性。
评估不同疾病和状态下细胞类型和亚型比例的组成变化。
使用scCODA贝叶斯模型进行组成分析,比较不同疾病组之间的细胞类型比例。
识别差异表达基因或亚型标记基因参与的通路和生物学过程。
使用fgsea进行基因集富集分析,基于limma-voom差异表达测试的t统计量对基因排序,使用基因本体生物学过程。
验证计算预测的COL22A1+和TNC+活化成纤维细胞亚群的实际存在。
使用RNAscope原位杂交技术,在新鲜冷冻心脏组织切片上同时检测POSTN、COL22A1和TNC表达,并使用三色染色评估纤维化区域。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| RNA测序数据预处理 | CellRanger | -- | 4.0.0 |
| CellBender | -- | 2.0.0 | |
| Scrublet | -- | -- | |
| Cutadapt | -- | -- | |
| 数据分析 | SCANPY | -- | 1.9.3 |
| Seurat | -- | 3 | |
| DESeq2 | -- | -- | |
| limma-voom | -- | -- | |
| scCODA | -- | 0.1.9 | |
| fgsea | -- | -- | |
| metafor | -- | -- | |
| ImageJ | -- | 1.54f | |
| R | -- | -- | |
| 实验验证 | RNAscope多重荧光试剂盒v2 | -- | -- |
| ProLong Gold封片剂 | -- | -- | |
| Leica SP8共聚焦显微镜 | Leica | -- | |
| Platinum LED灯P300 | Platinum LED Lights | P300 |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据整合 | 批量校正方法(scANVI)及其参数(潜在变量数25)是否相同 阅读提示:Methods中'Batch correction and evaluation of integration approaches'部分 |
| 细胞类型注释 | 聚类分辨率是否设为2.0,用于识别14种主要细胞类型 阅读提示:Methods中'Map aggregation, cell type annotation and marker genes'部分 |
| 差异表达分析 | 模型公式(Expr ~ 0 + disease + study + anatomy + sex)和用于控制重复的duplicateCorrelation 是否一致 阅读提示:Methods中'Pairwise DE analysis based on disease status and sex assignment by cell type'部分 |
| 扩张型心肌病跨研究分析 | DCM和对照组的样本数量及每个研究的分析模型(如Chaffin等和Koenig等使用~1+disease+sex,Reichart等使用~1+disease+sex+anatomy) 阅读提示:Methods中'Comparing DCM and non-failing controls across studies'部分 |
| 活化成纤维细胞验证 | 用于RNAscope的组织来源和疾病状态选择,光漂白时间(48小时),使用的探针(POSTN、COL22A1、TNC)及定量方法 阅读提示:Methods中'Photobleaching, RNAscope and immunofluorescence validation'部分 |