比较预测转录组的机器学习方法及其在关联研究中的应用

Comparing machine learning methods predicting transcriptome from epigenome with applications to association studies

作者信息Fatemeh Behjati Ardakani, Shamim Ashrafiyan, Laura Rumpf, Dennis Hecker, Marcel H Schulz
PMID42444001
发布时间2026-07-13
DOI10.1186/s13059-026-04131-w

实验完整度

包含模型训练、性能评估、CRISPRi和eQTL验证、细胞类型泛化测试以及HAWAS疾病关联分析等多个独立证据层级。

主要模型

IHEC EpiATLAS 人类样本(965个样本,51种细胞类型/组织) K562细胞系(用于CRISPRi验证) 慢性淋巴细胞白血病(CLL)患者样本 结肠腺癌患者样本

重点核对

模型特征设置:CRE、Binned和STITCHIT分割策略 训练-测试划分:随机80:20划分和留出细胞类型划分 超参数优化:每种方法为每个基因单独优化 验证数据集:CRISPRi和eQTL数据 HAWAS分析:使用CLL和结肠癌队列数据

摘要

背景:理解表观基因组变异如何导致疾病和发育中的基因表达是一个基本挑战。调控区域表现出细胞类型特异性的表观基因组活性,并且其位置、大小和与目标基因的距离各不相同,这使得发现和分析变得复杂。最近的机器学习模型已被提出,通过学习从表观基因组数据预测基因表达的函数来解决这些问题。结果:在这里,我们使用大型IHEC EpiATLAS数据集来基准测试最先进的线性和非线性方法。我们为超过28,000个人类基因优化了每种方法,提供了一个推断的基因模型调控目录。深入比较显示,基因特征和基因座的表观基因组复杂性影响预测表观基因组到转录组关联的难度。模型的性能进一步使用CRISPRi和eQTL验证数据进行评估。基于这些模型,我们以系统的方式进行了组蛋白乙酰化关联研究,以研究表观遗传变异如何影响基因表达。基于模型的分析揭示了与B细胞白血病相关的基因和调控区域,这些基因和调控区域在患者数据中具有已知的疾病相关功能。结论:我们的工作通过逐基因基准测试方法,展示其在疾病背景下的应用,并向社区提供训练好的模型,为将表观基因组变异与人类细胞中的基因表达联系起来的应用提供了基础。补充信息:在线版本包含补充材料,可在10.1186/s13059-026-04131-w获取。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
如何利用表观基因组数据(特别是H3K27ac)预测基因表达,并评估不同机器学习方法在基因特异性设置下的性能?
核心机制
H3K27ac标记的活性增强子和启动子与基因表达相关,基因特异性模型能够捕捉调控区域对表达的影响,基于这些模型可以推断疾病相关的基因和调控元件。
主要证据
基于965个样本的EpiATLAS数据训练和评估了五种机器学习方法;使用CRISPRi和eQTL数据验证了模型解释(ISP);并在CLL和结肠癌队列中展示了HAWAS应用。
研究意义
提供了一个逐基因基准测试框架,展示了模型在疾病关联研究中的应用,并提供了训练好的模型供社区使用。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

数据收集与预处理

构建用于模型训练和评估的基因表达和H3K27ac信号数据集。

从IHEC EpiATLAS获取匹配的RNA-seq和H3K27ac ChIP-seq数据,进行质量控制,筛选出28,180个基因。

2

特征构建与模型训练

为每个基因训练机器学习模型,以预测其表达水平。

采用CRE、binned和STITCHIT分割三种特征设置,应用线性(STITCHIT)和非线性(MLP、RF、CNN)方法训练基因特异性模型。

3

模型性能评估

比较不同方法在预测未见样本上的准确性。

使用随机80:20划分评估模型的预测性能,并分析基因特征对性能的影响。

4

模型解释

识别模型中重要的调控区域,理解调控机制。

采用in silico perturbation (ISP)方法计算每个特征的重要性,并分析与ChromHMM状态的富集。

5

外部验证

评估模型预测的增强子-基因相互作用的可靠性。

使用CRISPRi数据和eQTL数据验证ISP分数。

6

泛化性能测试

评估模型对未见过细胞类型的泛化能力。

使用留出细胞类型划分,基于细胞类型相似性选择测试样本,重新训练模型并评估性能。

7

疾病关联研究

利用训练的模型进行HAWAS,识别与疾病相关的基因和调控区域。

应用预训练的CRE-RF和Binned-CNN模型预测疾病和对照样本的基因表达,进行差异分析(HAWAS-gene),并计算ISP进行区域关联分析(HAWAS-region),进行转录因子富集和生存分析。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
randomForest--4.7.1.1
Keras----
scikit-learn----
RSEM----
DESeq2----
DiffBind--v.3.4.11
STARE--v.1.0.4
GSEApy--v.1.1.2
Survival Genie2----
pybedtools--v0.9.0
bedtools----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据准备
IHEC EpiATLAS样本的ID、细胞类型注释、基因注释版本
阅读提示:Methods:EpiATLAS epigenome and transcriptome data
特征构建
CRE集合来源、binned bin大小和数量、STITCHIT分段参数
阅读提示:Methods:Feature setups
模型训练
每种方法的超参数(如学习率、批量大小、树数等)
阅读提示:Methods:Setup for machine learning models
模型评估
训练-测试划分的比例和随机种子、性能指标(MSE和Pearson相关)
阅读提示:Methods:Data partitioning and cross validation for training
模型解释
ISP计算时的扰动值(设为0或小值)及归一化方法
阅读提示:Methods:In silico perturbation score calculation
外部验证
CRISPRi数据集版本和过滤标准、eQTL数据的组织匹配
阅读提示:Methods:Comparison on CRISPRi data via in silico perturbation 和 Ranking of eQTL-gene pairs
泛化测试
用于选择测试细胞类型的基因表达主成分空间距离阈值
阅读提示:Methods:Assessing model generalizability across distinct cell types
HAWAS分析
样本选择标准、DESeq2设计矩阵、FDR阈值
阅读提示:Methods:HAWAS on CLL and colon cancer data