视网膜母细胞瘤中的表观遗传因子失调与独特表达特征:一项转录组分析

Epigenetic Factor Dysregulation and Distinct Expression Signatures in Retinoblastoma: A Transcriptomic Analysis

作者信息Gaurab Kumar Jha, Azima Fatima, Alok Srivastava, Swathi Kaliki, Rani Pallavi
PMID42606187
发布时间2026-08-03
DOI10.1167/iovs.67.10.43

实验完整度

研究基于公共转录组数据(微阵列和RNA-seq)进行差异表达分析、NMF聚类、GSEA、GSVA及CORUM复合物分析,属于生物信息学分析,无湿实验验证,实验完整度中等。

主要模型

177例RB肿瘤样本(微阵列) 50例RB肿瘤样本(RNA-seq验证队列) 3例正常胎儿视网膜样本

重点核对

差异表达分析阈值:|Log2FC| ≥ 1,调整后P值 < 0.01 一致上调表观遗传因子的筛选条件:|Log2FC| ≥ 1.5,变异系数 < 5% NMF聚类使用前500个变异最大的表观遗传因子(按标准差排序) GSEA分析使用MSigDB Hallmark基因集,最小基因集大小15,FDR q值 < 0.25 RNA-seq验证队列:GSE268136,包含50例原发性RB肿瘤

摘要

目的:视网膜母细胞瘤(RB)中观察到的转录异质性无法用已鉴定的有限遗传改变来解释。表观遗传因子(Epifactors)能够调节转录活性和致癌通路,可能促成这种异质性。然而,关于表观遗传机制在RB中的作用的知识仍然有限。在此,我们分析表观遗传因子的表达,以揭示失调及其对RB肿瘤异质性的贡献。方法:从NCBI基因表达综合数据库(NCBI-GEO)获取原发性RB肿瘤和正常胎儿视网膜的转录组数据集。使用edgeR分析差异表达的表观遗传因子,并对鉴定的表观遗传因子进行功能注释。基于表观遗传因子的表达,采用非负矩阵分解(NMF)进行聚类。结果:我们发现133个表观遗传因子在RB中与健康视网膜相比差异表达。特别是,参与组蛋白磷酸化和RNA降解的表观遗传因子主要上调,而参与RNA甲基化调控的表观遗传因子大多下调。基于表观遗传因子表达,基于NMF的聚类将RB患者分为两个具有不同生物学特征的聚类。聚类1患者显示细胞周期和MYC程序的富集,而聚类2显示干扰素和炎症相关通路的富集。聚类与特定的表观遗传因子相关,这些因子形成聚类特异性的功能复合物,例如增殖性聚类1中的着丝粒/染色体过客复合物,以及免疫活性聚类2中的核受体/干扰素相关复合物。结论:RB中的转录组异质性似乎由表观遗传因子的表达塑造,提示RB异质性可能编码在其表观遗传机制中。表观遗传因子分析、聚类和复合物水平分析确定了可能作为潜在生物标志物和治疗干预靶点的关键表观遗传因子。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
视网膜母细胞瘤(RB)中表观遗传因子(epifactors)的表达是否失调,以及这些失调是否与RB的转录组异质性相关。
核心机制
表观遗传因子的表达失调,特别是涉及组蛋白磷酸化和RNA降解的表观遗传因子上调,以及RNA甲基化调节因子的下调,与RB的转录异质性相关。基于表观遗传因子表达,RB患者可分为两个亚型:增殖性亚型(富集细胞周期和MYC程序)和免疫炎症性亚型(富集干扰素和炎症通路),且每个亚型由特定的表观遗传因子及复合物驱动。
主要证据
基于微阵列队列(177例RB肿瘤和3例胎儿视网膜)鉴定出133个差异表达的表观遗传因子,并在独立RNA-seq队列(50例RB肿瘤)中验证了基于NMF的聚类结果。GSEA显示聚类1富集细胞周期和MYC通路,聚类2富集干扰素和炎症通路。CORUM数据库分析揭示聚类特异性表观遗传复合物,如聚类1中的着丝粒/染色体过客复合物和聚类2中的核受体/干扰素相关复合物。
研究意义
研究表明表观遗传因子表达可能编码RB的转录异质性,为RB的精准表观遗传建模提供基础,并可能促进基于表观遗传的生物标志物发现和治疗方法开发。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

数据获取与预处理

整合多个RB转录组数据集,构建用于分析的表观遗传因子表达矩阵。

从GEO下载GSE29683、GSE58780和GSE59983的微阵列数据,以及GSE268136的RNA-seq数据。使用RMA方法标准化微阵列数据,通过sva包的ComBat函数进行批次校正,将探针ID映射到ENTREZ基因符号,构建统一表达矩阵。

2

差异表达分析

识别RB与正常胎儿视网膜之间差异表达的表观遗传因子。

使用edgeR进行差异表达分析,并通过非参数bootstrap重采样(1000次迭代)评估稳健性。进一步应用更严格的筛选条件(|Log2FC| ≥ 1.5且CV < 5%)鉴定一致失调的表观遗传因子。

3

基于NMF的聚类分析

基于表观遗传因子表达,识别RB患者的分子亚型。

选择微阵列队列中标准差最大的500个表观遗传因子,使用NMF包进行非负矩阵分解聚类。通过一致性相关系数、轮廓系数和稀疏度等指标评估聚类稳定性,并在RNA-seq队列中验证聚类结果。

4

通路富集分析

揭示不同RB亚型富集的生物学通路。

使用GSEA对聚类样本进行基因集富集分析,使用MSigDB的Hallmark基因集。比较聚类1和聚类2的富集通路。

5

前导表观遗传因子鉴定

识别驱动RB患者聚类的关键表观遗传因子。

使用NMF包的extractFeatures函数提取每个聚类的前导表观遗传因子,并鉴定微阵列和RNA-seq队列共有的稳健前导表观遗传因子。通过GSVA评估这些前导因子的聚类特异性。

6

表观遗传复合物鉴定

探索聚类特异性前导表观遗传因子是否形成功能复合物。

将前导表观遗传因子映射到CORUM数据库,进行过表达分析(ORA),鉴定显著富集的表观遗传复合物,并通过GSVA比较复合物在聚类间的富集分数。

7

基于泛癌数据的生存分析

评估稳健前导表观遗传因子作为预后标志物的潜力。

使用GEPIA2网站,在TCGA泛癌数据中,以稳健前导表观遗传因子作为签名,进行无病生存期(DFS)分析。根据表达水平将患者分为高、低表达组,使用Kaplan-Meier曲线和log-rank检验比较生存差异。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据获取与预处理
微阵列数据集GSE29683、GSE58780和GSE59983的原始.CEL文件;RNA-seq数据集GSE268136;R软件版本4.2.1;affy包;sva包
阅读提示:Methods部分:Data Acquisition和Cohort Building and Epifactor Selection
差异表达分析
edgeR阈值:|Log2FC| ≥ 1,调整后P值 < 0.01;bootstrap重采样1000次;一致失调筛选:|Log2FC| ≥ 1.5,CV < 5%
阅读提示:Methods部分:Differential Gene Expression Analysis and Functional Annotation
NMF聚类
选择前500个SD最大的表观遗传因子;NMF包;聚类质量指标:cophenetic coefficient ≥ 0.8,silhouette index > 0.7,sparseness ≤ 0.3
阅读提示:Methods部分:Non-Negative Matrix Factorization Clustering and Gene Set Enrichment Analysis
GSEA分析
GSEA版本4.3.0;MSigDB Hallmark基因集;最小基因集大小15;FDR q值 < 0.25
阅读提示:Methods部分:Non-Negative Matrix Factorization Clustering and Gene Set Enrichment Analysis
生存分析
TCGA泛癌数据;GEPIA2;稳健前导表观遗传因子签名;四分位法分组(前25%高表达,后25%低表达);log-rank检验
阅读提示:Methods部分:Pan-Cancer Dataset Based Survival Analysis