数据收集与预处理
构建用于模型训练和评估的基因表达和H3K27ac信号数据集。
从IHEC EpiATLAS获取匹配的RNA-seq和H3K27ac ChIP-seq数据,进行质量控制,筛选出28,180个基因。
Comparing machine learning methods predicting transcriptome from epigenome with applications to association studies
包含模型训练、性能评估、CRISPRi和eQTL验证、细胞类型泛化测试以及HAWAS疾病关联分析等多个独立证据层级。
IHEC EpiATLAS 人类样本(965个样本,51种细胞类型/组织) K562细胞系(用于CRISPRi验证) 慢性淋巴细胞白血病(CLL)患者样本 结肠腺癌患者样本
模型特征设置:CRE、Binned和STITCHIT分割策略 训练-测试划分:随机80:20划分和留出细胞类型划分 超参数优化:每种方法为每个基因单独优化 验证数据集:CRISPRi和eQTL数据 HAWAS分析:使用CLL和结肠癌队列数据
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
构建用于模型训练和评估的基因表达和H3K27ac信号数据集。
从IHEC EpiATLAS获取匹配的RNA-seq和H3K27ac ChIP-seq数据,进行质量控制,筛选出28,180个基因。
为每个基因训练机器学习模型,以预测其表达水平。
采用CRE、binned和STITCHIT分割三种特征设置,应用线性(STITCHIT)和非线性(MLP、RF、CNN)方法训练基因特异性模型。
比较不同方法在预测未见样本上的准确性。
使用随机80:20划分评估模型的预测性能,并分析基因特征对性能的影响。
识别模型中重要的调控区域,理解调控机制。
采用in silico perturbation (ISP)方法计算每个特征的重要性,并分析与ChromHMM状态的富集。
评估模型预测的增强子-基因相互作用的可靠性。
使用CRISPRi数据和eQTL数据验证ISP分数。
评估模型对未见过细胞类型的泛化能力。
使用留出细胞类型划分,基于细胞类型相似性选择测试样本,重新训练模型并评估性能。
利用训练的模型进行HAWAS,识别与疾病相关的基因和调控区域。
应用预训练的CRE-RF和Binned-CNN模型预测疾病和对照样本的基因表达,进行差异分析(HAWAS-gene),并计算ISP进行区域关联分析(HAWAS-region),进行转录因子富集和生存分析。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 模型训练 | randomForest | -- | 4.7.1.1 |
| Keras | -- | -- | |
| scikit-learn | -- | -- | |
| 数据处理 | RSEM | -- | -- |
| 数据分析 | DESeq2 | -- | -- |
| DiffBind | -- | v.3.4.11 | |
| STARE | -- | v.1.0.4 | |
| GSEApy | -- | v.1.1.2 | |
| Survival Genie2 | -- | -- | |
| 数据处理 | pybedtools | -- | v0.9.0 |
| bedtools | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据准备 | IHEC EpiATLAS样本的ID、细胞类型注释、基因注释版本 阅读提示:Methods:EpiATLAS epigenome and transcriptome data |
| 特征构建 | CRE集合来源、binned bin大小和数量、STITCHIT分段参数 阅读提示:Methods:Feature setups |
| 模型训练 | 每种方法的超参数(如学习率、批量大小、树数等) 阅读提示:Methods:Setup for machine learning models |
| 模型评估 | 训练-测试划分的比例和随机种子、性能指标(MSE和Pearson相关) 阅读提示:Methods:Data partitioning and cross validation for training |
| 模型解释 | ISP计算时的扰动值(设为0或小值)及归一化方法 阅读提示:Methods:In silico perturbation score calculation |
| 外部验证 | CRISPRi数据集版本和过滤标准、eQTL数据的组织匹配 阅读提示:Methods:Comparison on CRISPRi data via in silico perturbation 和 Ranking of eQTL-gene pairs |
| 泛化测试 | 用于选择测试细胞类型的基因表达主成分空间距离阈值 阅读提示:Methods:Assessing model generalizability across distinct cell types |
| HAWAS分析 | 样本选择标准、DESeq2设计矩阵、FDR阈值 阅读提示:Methods:HAWAS on CLL and colon cancer data |