数据整合与预处理
整合多队列肝脏转录组数据并校正批次效应,为轨迹推断提供标准化输入。
使用公开的UCAM和VCU队列RNA-seq数据,进行质量控制和批次校正(COMBAT),以性别为协变量。
A data-driven framework reconstructs the molecular continuum of human MASLD progression
基于跨队列转录组数据分析、网络构建、细胞去卷积及机器学习模型验证,主要依赖公开数据集,无湿实验功能验证。
人类MASLD肝脏转录组队列(UCAM/VCU) 外部验证转录组队列(EPoS、Gubra、Fujiwara) 血浆蛋白质组队列(Govaere)
伪时序排序算法(Slingshot)及轨迹推断参数 145基因特征提取的随机森林分类器及交叉验证设置 57基因生物标志物panel的构成及在独立队列中的AUC 细胞类型去卷积方法及参考图谱(Liver Cell Atlas)
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
整合多队列肝脏转录组数据并校正批次效应,为轨迹推断提供标准化输入。
使用公开的UCAM和VCU队列RNA-seq数据,进行质量控制和批次校正(COMBAT),以性别为协变量。
使用无监督方法将患者按分子相似性排序,构建连续疾病轨迹。
应用Slingshot对标准化后的转录组数据进行伪时序排序,获得轨迹坐标。
识别最能代表疾病轨迹的基因特征,并验证其在独立数据集中的泛化性。
使用随机森林分类器从载荷基因中筛选出145个基因,并在EPoS、Gubra和Fujiwara数据集中验证轨迹重现能力。
以连续方式划分患者轨迹,捕捉分子变化的时序动态。
开发基于图的方法确定最优滑动窗口序列,将患者分为13个重叠组,进行差异表达、TF活性及网络分析。
整合共表达模块、转录因子和上游通路,构建疾病调控网络。
使用WGCNA识别模块,结合TF富集和PCSF算法构建全局网络,并验证与已知MASLD基因的富集。
评估轨迹中肝脏细胞组成的变化及其与分子通路的关系。
使用Liver Cell Atlas作为参考,应用多种去卷积方法(如CIBERSORT、BayesPrism)估计细胞比例,并进行通路-细胞类型关联分析。
开发可无创检测的血浆生物标志物,用于纤维化分期和轨迹定位。
将MASLD网络与Govaere的194个血浆-肝脏相关基因交集,得到57基因;用随机森林分类和回归模型预测纤维化阶段和轨迹位置,并在外部数据集验证。
按研究目的归类文中使用的方法,便于定位所需技术。
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据预处理 | 批次校正方法(COMBAT)及协变量(性别);是否排除离群样本 阅读提示:Methods: RNA-seq analysis and data processing |
| 伪时序排序 | 排序算法(Slingshot)的具体参数;是否使用全转录组或145基因特征 阅读提示:Methods: Pseudo-temporal ordering of patients |
| 特征基因筛选 | 随机森林分类器的超参数(如树数量);训练集和验证集划分 阅读提示:Methods: Extraction of 145 gene signatures using random forest classification |
| 滑动窗口分析 | 窗口大小集合和重叠比例;DEG阈值(FDR<0.1);最优路径选择标准 阅读提示:Methods: Patients’ stratification into sliding windows |
| 网络构建 | WGCNA参数(软阈值、deepSplit、minClusterSize);PCSF参数(边成本、节点奖赏);网络来源数据库 阅读提示:Methods: Construction of the global MASLD network |
| 细胞去卷积 | 参考图谱(Liver Cell Atlas)的具体数据版本;去卷积方法列表及参数 阅读提示:Methods: Cell-type deconvolution analysis |
| 生物标志物模型 | 分类和回归模型的训练/测试划分比例;特征选择(elbow方法)的具体阈值;表达归一化方法(z-score) 阅读提示:Methods: Machine-learning models for non-invasive MASLD biomarker prediction |