比较预测表观基因组到转录组的机器学习方法及其在关联研究中的应用

Comparing machine learning methods predicting transcriptome from epigenome with applications to association studies

作者信息Fatemeh Behjati Ardakani, Shamim Ashrafiyan, Laura Rumpf, Dennis Hecker, Marcel H Schulz
PMID42444001
发布时间2026-07-13
DOI10.1186/s13059-026-04131-w

摘要

背景:理解表观基因组变异如何在疾病和发育中影响基因表达是一个基本挑战。调控区域表现出细胞类型特异性的表观基因组活性,并且在其位置、大小和与靶基因的距离上存在差异,这使得发现和分析变得复杂。最近的机器学习模型通过学习从表观基因组数据预测基因表达的函数来解决这些问题。结果:在此,我们使用大型IHEC EpiATLAS数据集来评估最先进的线性和非线性方法。我们为超过28,000个人类基因优化了每种方法,提供了一个推断的基因模型调控目录。深入比较揭示了基因特征和基因座的表观基因组复杂性影响预测表观基因组到转录组关联的难度。模型性能进一步使用CRISPRi和eQTL验证数据进行评估。基于这些模型,我们以系统化的方式进行组蛋白乙酰化关联研究,以探究表观遗传变异如何影响基因表达。基于模型的分析揭示了在具有已知疾病相关功能的患者数据中与B细胞白血病相关的基因和调控区域。结论:我们的工作通过在逐个基因的基础上对方法进行基准测试,说明其在疾病背景下的使用,并向社区提供训练好的模型,为将表观基因组变异与人类细胞中基因表达联系起来提供了应用基础。

实验方法