数据获取与预处理
获取全基因组染色质可及性和转录组数据,为识别调控单元提供基础。
从公共数据库下载恶性疟原虫3D7株八个时间点的ATAC-Seq和RNA-Seq数据,以及AP2-I的ChIP-Seq数据。
The human malaria parasite genome is configured into thousands of coexpressed linear regulatory units
本文主要为基于公共数据的生物信息学分析,未提供具体实验方法细节,属基因组数据分析研究。
恶性疟原虫3D7株 红细胞内期发育同步化寄生虫
使用的RNA-Seq和ATAC-Seq数据来自八个时间点(5, 10, 15, 20, 25, 30, 45, 40小时)的恶性疟原虫3D7寄生虫 AP2-I结合位点来自ChIP-Seq数据(Santos等,2017) HMM模型的平均后验概率阈值设为0.99 调控单元长度中位数为4.7kb
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
获取全基因组染色质可及性和转录组数据,为识别调控单元提供基础。
从公共数据库下载恶性疟原虫3D7株八个时间点的ATAC-Seq和RNA-Seq数据,以及AP2-I的ChIP-Seq数据。
量化每个基因组元件(基因或ATAC峰)的上下游调控偏向。
对每个基因组元件,计算其与上下游元件的表达和染色质可及性信号的Pearson相关性,形成方向性向量。
利用隐马尔可夫模型推断调控单元的位置。
以方向性向量为观测,构建四状态HMM(上游偏向、无偏向、下游偏向、双向),使用Baum-Welch算法估计参数,后验概率≥0.99的连续状态区域被定义为调控单元。
评估识别出的调控单元的可靠性。
将HMM识别的调控单元与简单相关性截断法识别的单元比较,并检查与已知共表达基因簇和eQTL的关联。
基于调控单元重新确定AP2-I转录因子的靶基因。
将AP2-I结合位点映射到调控单元,将同一调控单元内的基因预测为AP2-I靶基因,并与以往方法比较。
按研究目的归类文中使用的方法,便于定位所需技术。
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据获取 | 数据集的来源和版本 阅读提示:Methods部分“Public data sets analyzed” |
| 调控单元识别 | HMM的状态数、后验概率阈值 阅读提示:Methods部分“DV, RU, and boundary calling” |
| AP2-I靶基因预测 | AP2-I结合位点数据的来源和调用标准 阅读提示:Methods部分“Public data sets analyzed”和结果2.4节 |