数据获取与预处理
整合多个RB转录组数据集,构建用于分析的表观遗传因子表达矩阵。
从GEO下载GSE29683、GSE58780和GSE59983的微阵列数据,以及GSE268136的RNA-seq数据。使用RMA方法标准化微阵列数据,通过sva包的ComBat函数进行批次校正,将探针ID映射到ENTREZ基因符号,构建统一表达矩阵。
Epigenetic Factor Dysregulation and Distinct Expression Signatures in Retinoblastoma: A Transcriptomic Analysis
研究基于公共转录组数据(微阵列和RNA-seq)进行差异表达分析、NMF聚类、GSEA、GSVA及CORUM复合物分析,属于生物信息学分析,无湿实验验证,实验完整度中等。
177例RB肿瘤样本(微阵列) 50例RB肿瘤样本(RNA-seq验证队列) 3例正常胎儿视网膜样本
差异表达分析阈值:|Log2FC| ≥ 1,调整后P值 < 0.01 一致上调表观遗传因子的筛选条件:|Log2FC| ≥ 1.5,变异系数 < 5% NMF聚类使用前500个变异最大的表观遗传因子(按标准差排序) GSEA分析使用MSigDB Hallmark基因集,最小基因集大小15,FDR q值 < 0.25 RNA-seq验证队列:GSE268136,包含50例原发性RB肿瘤
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
整合多个RB转录组数据集,构建用于分析的表观遗传因子表达矩阵。
从GEO下载GSE29683、GSE58780和GSE59983的微阵列数据,以及GSE268136的RNA-seq数据。使用RMA方法标准化微阵列数据,通过sva包的ComBat函数进行批次校正,将探针ID映射到ENTREZ基因符号,构建统一表达矩阵。
识别RB与正常胎儿视网膜之间差异表达的表观遗传因子。
使用edgeR进行差异表达分析,并通过非参数bootstrap重采样(1000次迭代)评估稳健性。进一步应用更严格的筛选条件(|Log2FC| ≥ 1.5且CV < 5%)鉴定一致失调的表观遗传因子。
基于表观遗传因子表达,识别RB患者的分子亚型。
选择微阵列队列中标准差最大的500个表观遗传因子,使用NMF包进行非负矩阵分解聚类。通过一致性相关系数、轮廓系数和稀疏度等指标评估聚类稳定性,并在RNA-seq队列中验证聚类结果。
揭示不同RB亚型富集的生物学通路。
使用GSEA对聚类样本进行基因集富集分析,使用MSigDB的Hallmark基因集。比较聚类1和聚类2的富集通路。
识别驱动RB患者聚类的关键表观遗传因子。
使用NMF包的extractFeatures函数提取每个聚类的前导表观遗传因子,并鉴定微阵列和RNA-seq队列共有的稳健前导表观遗传因子。通过GSVA评估这些前导因子的聚类特异性。
探索聚类特异性前导表观遗传因子是否形成功能复合物。
将前导表观遗传因子映射到CORUM数据库,进行过表达分析(ORA),鉴定显著富集的表观遗传复合物,并通过GSVA比较复合物在聚类间的富集分数。
评估稳健前导表观遗传因子作为预后标志物的潜力。
使用GEPIA2网站,在TCGA泛癌数据中,以稳健前导表观遗传因子作为签名,进行无病生存期(DFS)分析。根据表达水平将患者分为高、低表达组,使用Kaplan-Meier曲线和log-rank检验比较生存差异。
按研究目的归类文中使用的方法,便于定位所需技术。
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据获取与预处理 | 微阵列数据集GSE29683、GSE58780和GSE59983的原始.CEL文件;RNA-seq数据集GSE268136;R软件版本4.2.1;affy包;sva包 阅读提示:Methods部分:Data Acquisition和Cohort Building and Epifactor Selection |
| 差异表达分析 | edgeR阈值:|Log2FC| ≥ 1,调整后P值 < 0.01;bootstrap重采样1000次;一致失调筛选:|Log2FC| ≥ 1.5,CV < 5% 阅读提示:Methods部分:Differential Gene Expression Analysis and Functional Annotation |
| NMF聚类 | 选择前500个SD最大的表观遗传因子;NMF包;聚类质量指标:cophenetic coefficient ≥ 0.8,silhouette index > 0.7,sparseness ≤ 0.3 阅读提示:Methods部分:Non-Negative Matrix Factorization Clustering and Gene Set Enrichment Analysis |
| GSEA分析 | GSEA版本4.3.0;MSigDB Hallmark基因集;最小基因集大小15;FDR q值 < 0.25 阅读提示:Methods部分:Non-Negative Matrix Factorization Clustering and Gene Set Enrichment Analysis |
| 生存分析 | TCGA泛癌数据;GEPIA2;稳健前导表观遗传因子签名;四分位法分组(前25%高表达,后25%低表达);log-rank检验 阅读提示:Methods部分:Pan-Cancer Dataset Based Survival Analysis |