结直肠癌诊断中丁酸代谢相关生物标志物的鉴定与验证

Identification and validation of butyrate metabolism-related biomarkers for colorectal cancer diagnosis.

作者信息Miao Yu, Qian Chen, Tianhe Gu, Yiping Lu
PMID41907458
期刊PeerJ
发布时间2026-03-23
DOI10.7717/peerj.20942

实验完整度

包含多数据集生物信息学筛选、生存分析、ceRNA网络构建及qRT-PCR验证,但缺乏动物模型和功能机制验证。

主要模型

TCGA-CRC数据集(含COAD和READ) GEO数据集(GSE41258和GSE39582) 正常结肠上皮细胞系NCM-460 结肠癌细胞系LOVO、HCT116、LS174T、LS513

重点核对

生物标志物(CCND1、CXCL8、MMP3、MYC、TIMP1、VEGFA)在CRC与正常组织中的表达差异 LASSO回归分析中lambda值的选择及交叉验证 ROC曲线分析中AUC值大于0.7的标准 qRT-PCR验证中细胞系的选择及培养条件 生存分析中高低表达组的划分阈值(中位数)

摘要

背景:与以丁酸作为主要能量来源的正常结肠细胞不同,癌性结肠细胞更倾向于利用葡萄糖。然而,关于丁酸代谢在结直肠癌(CRC)病理生理学中的调节作用机制的研究仍不够深入。方法:该研究综合分析四个数据集(癌症基因组图谱(TCGA)-COAD、TCGA-READ、GSE41258和GSE39582)以及与丁酸代谢相关基因(BMGs)相关的基因集。通过重叠BMGs、TCGA-DEGs(CRC与正常组之间的差异表达基因)和GEO-DEGs(基因表达综合数据库的CRC与正常组之间的差异表达基因)筛选差异表达的BMGs(DE-BMGs),并进行富集分析。随后通过蛋白质-蛋白质相互作用(PPI)网络分析筛选Hub基因。通过应用最小绝对收缩和选择算子(LASSO)和受试者工作特征(ROC)曲线分析改进生物标志物的选择。根据不同的临床表型进行亚组生存分析。随后构建了以竞争性内源RNA为模型的调控网络。最后,基于正常结肠上皮细胞(NCM-460)和结肠癌细胞(LOVO、HCT116、LS174T和LS513),使用实时定量聚合酶链反应(qRT-PCR)方法检测两组之间生物标志物的差异表达。结果:共获得63个DE-BMGs。富集分析显示DE-BMGs与信号受体激活剂活性和过氧化物酶体增殖物激活受体主导的通路显著相关。随后,通过PPI、LASSO和ROC曲线验证分析获得六个总生物标志物(CCND1、CXCL8、MMP3、MYC、TIMP1和VEGFA)。生存分析显示不同临床队列之间的生存指标存在显著差异。独创性通路分析表明,与已识别生物标志物相关的通路被破坏,尤其是与肿瘤微环境相关的通路。最后,针对五个关键生物标志物(CCND1、CXCL8、MMP3、MYC和VEGFA)开发了一个包含156种药理药物的计算预测模型。qRT-PCR研究结果表明,CCND1、CXCL8、MYC和VEGFA在CRC细胞系中上调,这一观察结果与现有公共数据库记录一致。结论:筛选出六个丁酸代谢相关生物标志物(CCND1、CXCL8、MMP3、MYC、TIMP1和VEGFA),为探索CRC诊断的预测提供了基础。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
丁酸代谢相关基因在结直肠癌中的表达变化及其作为诊断生物标志物的潜力如何?
核心机制
丁酸代谢相关基因可能通过PPAR信号通路等机制影响结直肠癌的发生发展,但具体机制未被直接验证。
主要证据
基于TCGA和GEO数据集的差异表达分析、PPI网络、LASSO和ROC曲线筛选出六个生物标志物;qRT-PCR验证了CCND1、CXCL8、MYC和VEGFA在CRC细胞系中上调。
研究意义
为探索CRC诊断预测提供了新的生物标志物基础,并为理解丁酸代谢在CRC发病机制中的作用提供了新视角。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

数据获取与差异表达分析

识别结直肠癌与正常组织之间的差异表达基因,并筛选与丁酸代谢相关的差异表达基因(DE-BMGs)。

从TCGA和GEO获取CRC和正常样本的转录组数据,利用DESeq2和limma包进行差异表达分析,并与BMGs取交集得到63个DE-BMGs。

2

功能富集分析

探究DE-BMGs参与的生物学过程及信号通路。

使用clusterProfiler包进行GO和KEGG富集分析,发现DE-BMGs富集于信号受体激活剂活性等GO条目和PPAR信号通路等KEGG通路。

3

蛋白质互作网络与关键基因筛选

通过PPI网络和LASSO回归筛选与丁酸代谢相关的核心生物标志物。

利用STRING数据库构建PPI网络(63个节点,223条边),通过cytoHubba的MCC算法筛选top10 hub基因,再用LASSO回归(10倍交叉验证)筛选出6个特征基因,并通过ROC曲线评估其诊断价值。

4

表达水平验证

验证生物标志物在独立数据集中的表达差异。

在TCGA-CRC、GSE41258和GSE39582数据集中比较生物标志物在CRC和正常样本中的表达,结果显示所有标志物在CRC中显著升高(P<0.0001),并构建了列线图预测CRC风险。

5

生存及临床特征分析

评估生物标志物表达水平与患者预后及临床特征的关系。

根据中位表达值将TCGA-CRC样本分为高低表达组,绘制Kaplan-Meier曲线并进行log-rank检验,同时分析年龄、性别、分期等临床特征与生物标志物表达的关系,并进行多因素Cox回归分析。

6

IPA通路分析

探索生物标志物影响的信号通路。

使用IPA对DE-BMGs进行通路分析,发现生物标志物与肿瘤微环境相关通路密切相关(|Z-score|>2)。

7

ceRNA调控网络构建

揭示生物标志物的上游调控机制。

利用TCGA数据筛选DE-miRNAs和DE-lncRNAs,预测miRNAs和lncRNAs,通过交集和相关性分析构建lncRNA-miRNA-mRNA调控网络,涉及4个mRNA、4个miRNA和51个lncRNA。

8

药物-基因相互作用预测

预测可靶向生物标志物的药物,为CRC治疗提供参考。

使用DGIdb数据库预测靶向生物标志物的药物,构建药物-基因网络,共获得156种潜在药物。

9

qRT-PCR实验验证

在细胞水平验证生物标志物的表达差异。

培养正常结肠上皮细胞NCM-460和结肠癌细胞系LOVO、HCT116、LS174T、LS513,提取RNA并逆转录,使用qRT-PCR检测生物标志物的mRNA表达水平,以GAPDH为内参。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
DMEM培养基----
McCOY's 5A培养基----
F12K培养基----
RPMI 1640培养基----
胎牛血清----
青霉素-链霉素----
胰蛋白酶----
TRIZOL试剂Invitrogen--
NanoPhotometer N50Implen--
SureScript第一链cDNA合成试剂盒ABclonal--
2xUniversal Blue SYBR Green qPCR预混液Servicebio--
引物----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据获取与差异表达分析
TCGA和GEO数据集的版本及样本数量、差异表达分析的阈值(调整P<0.05,log2FC>1)
阅读提示:Materials and Methods: Data source, Identification of differentially expressed BMGs
生物标志物筛选
PPI网络构建的最小置信度(0.4)、LASSO回归的交叉验证次数(10倍)及lambda选择、ROC分析中AUC的阈值(>0.7)
阅读提示:Materials and Methods: Protein–protein interaction and least absolute shrinkage and selection operator analyses
表达验证
验证数据集(GSE41258和GSE39582)的具体样本组成、检验方法(Wilcoxon秩和检验)、显著性水平(P<0.05)
阅读提示:Materials and Methods: Expression-level validation in datasets
生存分析
高低表达组的划分依据(中位数)、使用的检验方法(log-rank检验)、显著性水平(P<0.05)、多因素Cox回归中纳入的变量
阅读提示:Materials and Methods: Survival and clinical features analysis
qRT-PCR验证
细胞系名称及来源、培养条件(培养基、血清浓度、CO2浓度)、RNA提取和逆转录试剂盒、qRT-PCR反应体系(各组分体积)、内参基因(GAPDH)及数据分析方法(2^-ΔΔCT)
阅读提示:Materials and Methods: The quantitative real-time polymerase chain reaction