基于数据驱动的框架重构人类MASLD进展的分子连续体

A data-driven framework reconstructs the molecular continuum of human MASLD progression

作者信息Ioannis Kamzolas, Thodoris Koutsandreas, Charlie George Barker, Anna Vathrakokoili Pournara, Harry Weston, Naoto Fujiwara, Yujin Hoshida, Quentin M Anstee, Michele Vacca, Irene Papatheodorou, Antonio Vidal-Puig, Evangelia Petsalaki
PMID42448794
期刊Nat Metab
发布时间2026-07
DOI10.1038/s42255-026-01543-7

实验完整度

基于跨队列转录组数据分析、网络构建、细胞去卷积及机器学习模型验证,主要依赖公开数据集,无湿实验功能验证。

主要模型

人类MASLD肝脏转录组队列(UCAM/VCU) 外部验证转录组队列(EPoS、Gubra、Fujiwara) 血浆蛋白质组队列(Govaere)

重点核对

伪时序排序算法(Slingshot)及轨迹推断参数 145基因特征提取的随机森林分类器及交叉验证设置 57基因生物标志物panel的构成及在独立队列中的AUC 细胞类型去卷积方法及参考图谱(Liver Cell Atlas)

摘要

代谢功能障碍相关脂肪性肝病(MASLD)沿着从单纯性脂肪变性到脂肪性肝炎、纤维化、肝硬化和肝细胞癌的连续体进展。然而,当前的临床和研究框架主要依赖于静态的、组织学定义的阶段,未能捕捉疾病进展的连续性。在此,我们提出一个数据驱动的框架,从横断面肝脏转录组谱中重构MASLD进展为连续的分子轨迹。通过将患者沿此轨迹定位,我们超越了传统的基于阶段的分类,并解析了疾病进展背后的调控程序、信号通路和细胞重塑过程的有序激活。为了实现非侵入性患者分层,我们将推断的分子轨迹与配对的肝脏-血浆蛋白质组学数据整合,并识别出一个57基因的血浆可及生物标志物组合,该组合可准确预测晚期纤维化,并在独立队列中连续定位患者沿疾病轨迹的位置,优于已建立的非侵入性临床评分。总之,这项工作建立了一个可推广的基于轨迹的框架,用于理解MASLD病理生理学,并为机制导向的生物标志物发现、精确分期和分期感知治疗优先级提供了基础。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
如何从横断面肝脏转录组数据重构MASLD进展的连续分子轨迹,并整合血浆蛋白质组实现非侵入性患者分层?
核心机制
MASLD进展表现为从代谢重编程(脂质代谢、转录调控)向炎症、细胞外基质重塑和纤维化信号(TGF-β、NF-κB等)的连续转变,伴随细胞组成变化(肝细胞减少,免疫细胞、成纤维细胞增加)。
主要证据
基于UCAM/VCU队列(n=135)的转录组数据推断轨迹,与组织学评分显著相关;145基因特征在EPoS、Gubra等外部队列中重现轨迹;57基因生物标志物在Fujiwara、EPoS队列及血浆蛋白质组中预测晚期纤维化(AUC 0.79-0.86)并预测轨迹位置。
研究意义
提供了一个基于轨迹的通用框架,用于理解MASLD病理生理学,并为机制导向的生物标志物发现、精确分期和分期感知治疗优先级奠定基础。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

数据整合与预处理

整合多队列肝脏转录组数据并校正批次效应,为轨迹推断提供标准化输入。

使用公开的UCAM和VCU队列RNA-seq数据,进行质量控制和批次校正(COMBAT),以性别为协变量。

2

伪时序轨迹推断

使用无监督方法将患者按分子相似性排序,构建连续疾病轨迹。

应用Slingshot对标准化后的转录组数据进行伪时序排序,获得轨迹坐标。

3

特征基因筛选与轨迹验证

识别最能代表疾病轨迹的基因特征,并验证其在独立数据集中的泛化性。

使用随机森林分类器从载荷基因中筛选出145个基因,并在EPoS、Gubra和Fujiwara数据集中验证轨迹重现能力。

4

滑动窗口分析

以连续方式划分患者轨迹,捕捉分子变化的时序动态。

开发基于图的方法确定最优滑动窗口序列,将患者分为13个重叠组,进行差异表达、TF活性及网络分析。

5

MASLD网络构建

整合共表达模块、转录因子和上游通路,构建疾病调控网络。

使用WGCNA识别模块,结合TF富集和PCSF算法构建全局网络,并验证与已知MASLD基因的富集。

6

细胞类型去卷积

评估轨迹中肝脏细胞组成的变化及其与分子通路的关系。

使用Liver Cell Atlas作为参考,应用多种去卷积方法(如CIBERSORT、BayesPrism)估计细胞比例,并进行通路-细胞类型关联分析。

7

生物标志物开发与验证

开发可无创检测的血浆生物标志物,用于纤维化分期和轨迹定位。

将MASLD网络与Govaere的194个血浆-肝脏相关基因交集,得到57基因;用随机森林分类和回归模型预测纤维化阶段和轨迹位置,并在外部数据集验证。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
FastQC----
hisat2----
HTSeq----
biomaRt----
COMBAT----
Slingshot----
DESeq2----
VIPER----
PCSF----
igraph----
CATD----
EpiDISH----
bseqsc----
DWLS----
CIBERSORT----
FARDEEP----
BayesPrism----
Seurat----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据预处理
批次校正方法(COMBAT)及协变量(性别);是否排除离群样本
阅读提示:Methods: RNA-seq analysis and data processing
伪时序排序
排序算法(Slingshot)的具体参数;是否使用全转录组或145基因特征
阅读提示:Methods: Pseudo-temporal ordering of patients
特征基因筛选
随机森林分类器的超参数(如树数量);训练集和验证集划分
阅读提示:Methods: Extraction of 145 gene signatures using random forest classification
滑动窗口分析
窗口大小集合和重叠比例;DEG阈值(FDR<0.1);最优路径选择标准
阅读提示:Methods: Patients’ stratification into sliding windows
网络构建
WGCNA参数(软阈值、deepSplit、minClusterSize);PCSF参数(边成本、节点奖赏);网络来源数据库
阅读提示:Methods: Construction of the global MASLD network
细胞去卷积
参考图谱(Liver Cell Atlas)的具体数据版本;去卷积方法列表及参数
阅读提示:Methods: Cell-type deconvolution analysis
生物标志物模型
分类和回归模型的训练/测试划分比例;特征选择(elbow方法)的具体阈值;表达归一化方法(z-score)
阅读提示:Methods: Machine-learning models for non-invasive MASLD biomarker prediction