糖尿病肾病糖酵解相关诊断标志物的鉴定与验证:基于整合机器学习和单细胞测序的研究

Identification and validation of glycolysis-related diagnostic signatures in diabetic nephropathy: a study based on integrative machine learning and single-cell sequence.

作者信息Xiaoyin Wu, Buyu Guo, Xingyu Chang, Yuxuan Yang, Qianqian Liu, Jiahui Liu, Yichen Yang, Kang Zhang, Yumei Ma, Songbo Fu
PMID39916957
发布时间2025-01-23
DOI10.3389/fimmu.2024.1427626

实验完整度

包含转录组数据分析、机器学习建模、单细胞分析及体外细胞实验验证,但缺乏动物模型和临床样本验证,功能验证仅限mRNA和蛋白表达。

主要模型

HK-2细胞系(高糖诱导的糖尿病肾病体外模型) GEO转录组数据集(MetaGSE及外部验证集) 单细胞RNA测序数据集GSE183276

重点核对

HK-2细胞培养条件,包括DMEM/F12培养基、10% FBS、1%青霉素-链霉素,37°C、5% CO2 高糖处理浓度:17.5 mM(对照)和45 mM(实验组),处理48小时 RT-qPCR检测12个诊断特征基因的mRNA表达 Western blot检测CD163蛋白表达 机器学习模型构建参数:SVM+Enet (alpha=0.6),lambda.min=0.02732

摘要

背景: 糖尿病肾病(DN)是糖尿病全身微血管病变的并发症。糖酵解异常已成为DN慢性肾功能障碍的潜在因素。目前缺乏可靠的预测性生物标志物,阻碍了早期诊断和个体化治疗。方法: 从GEO数据库中提取DN样本和对照的转录组谱。鉴定差异表达基因(DEGs)及其功能富集。通过结合DEGs、加权基因共表达网络和糖酵解候选基因,筛选糖酵解相关基因(GRGs)。我们通过整合机器学习框架建立了一种称为GScore的诊断特征。通过决策曲线和校准曲线评估诊断效能。使用单细胞RNA测序数据鉴定细胞亚型和交互信号。使用cMAP数据库寻找靶向GScore的潜在治疗药物。在体外验证诊断特征的表达水平。结果: 通过108种机器学习算法的组合,我们筛选出12个诊断特征,包括CD163, CYBB, ELF3, FCN1, PROM1, GPR65, LCN2, LTF, S100A4, SOX4, TGFB1和TNFAIP8。基于这些特征,建立了一个名为GScore的整合模型,用于预测DN发病和分层临床风险。我们观察到高风险组和低风险组之间具有不同的生物学特征和免疫微环境状态。GScore与中性粒细胞和非经典单核细胞显著相关。鉴定出靶向12个诊断特征的潜在药物,包括艾司洛尔、雌二醇、更昔洛韦和非尔氨酯。体外实验中,高糖诱导的HK-2细胞系中ELF3、LCN2和CD163被诱导。结论: 整合机器学习框架利用糖酵解相关基因建立了一种新的诊断特征。本研究为DN的早期诊断和治疗提供了新方向。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
筛选与糖尿病肾病糖酵解相关的诊断标志物,并构建预测模型以辅助早期诊断和风险分层。
核心机制
糖酵解异常与DN进展相关,涉及免疫微环境改变,中性粒细胞和非经典单核细胞可能发挥重要作用。
主要证据
基于转录组数据的差异表达分析和WGCNA鉴定GRGs,整合机器学习构建GScore模型,在外部验证集中显示良好预测性能;单细胞分析显示GScore与中性粒细胞和非经典单核细胞相关;体外实验验证了部分诊断标志物表达差异。
研究意义
本研究为DN的早期诊断和治疗提供了新的方向,GScore模型有望作为DN预测和治疗决策支持系统。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

数据获取与预处理

整合多个GEO数据集,校正批次效应,为后续分析提供高质量转录组数据。

从GEO数据库获取7个微阵列数据集和1个单细胞RNA-seq数据集,合并GSE47183、GSE47184、GSE104948、GSE104954为MetaGSE队列,使用limma包的normalizeBetweenArrays和removeBatchEffect进行数据校正和批次效应去除。

2

差异表达基因和功能富集分析

识别DN与对照之间的差异表达基因,并了解其生物学功能。

使用limma包在MetaGSE中鉴定DEGs,阈值调整后P<0.05且|log2FC|>0.5,进行GO、KEGG、REACTOME富集分析。

3

加权基因共表达网络分析(WGCNA)

识别与DN高度相关的基因模块,缩小候选基因范围。

对MetaGSE样本进行层次聚类去除异常值,选择软阈值power=7构建网络,识别20个共表达模块,其中MEturquoise模块与DN正相关(cor=0.52, p=1.21e-07),筛选GS>0.25且MM>0.7的370个关键基因。

4

糖酵解相关基因筛选

获得糖酵解相关基因列表,用于后续机器学习建模。

从文献、GeneCards、Hallmark_GLYCOLYSIS和REACTOME_GLYCOLYSIS基因集获取候选基因,与WGCNA关键基因和DEGs取交集,得到46个GRGs。

5

机器学习模型构建与验证

利用机器学习算法组合筛选诊断标志物,建立GScore模型。

将MetaGSE按7:3分为训练集和内部验证集,应用10种机器学习算法(Lasso, Ridge, Enet, RF, Stepglm, GBM, SVM, XGBoost, glmBoost, Naive Bayes)的108种组合,10折交叉验证评估AUC,选择SVM+Enet(alpha=0.6)组合,筛选出12个诊断基因,并基于ssGSEA计算GScore。

6

模型评估

评估GScore模型的预测性能和临床实用性。

绘制校准曲线和决策曲线评估模型准确性,计算各诊断特征的AUC值,并构建列线图。

7

免疫浸润分析

探究DN免疫微环境特征及诊断标志物与免疫细胞的关系。

使用ssGSEA量化28种免疫细胞浸润水平,比较DN和对照组差异,并分析诊断特征与免疫细胞的相关性。

8

风险分层和生物学特征分析

评估GScore的风险分层能力,并探索高低风险组的生物学差异。

根据GScore中位数将样本分为高风险和低风险组,比较两组差异表达基因,并进行GO、KEGG、GSEA富集分析,分析GScore与免疫细胞相关性。

9

单细胞RNA-seq分析

在单细胞水平解析GScore在免疫细胞亚型中的分布及细胞通讯。

使用Seurat处理GSE183276数据,鉴定细胞亚型,用AUCell评估各细胞类型的GScore,并使用CellChat分析细胞通讯。

10

潜在治疗药物预测

寻找可能靶向诊断特征的潜在治疗药物。

使用cMAP数据库,根据12个诊断特征筛选负评分药物,选择艾司洛尔、雌二醇、更昔洛韦和非尔氨酯。

11

体外实验验证

验证诊断特征在体外DN模型中的表达水平。

使用HK-2细胞,高糖诱导建立DN模型,RT-qPCR检测12个基因表达,WB检测CD163蛋白表达。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
DMEM/F12培养基Servicebio--
胎牛血清Pricella--
青霉素-链霉素Biosharp--
细胞计数试剂盒-8BeyotimeC0038
SteadyPure通用RNA提取试剂盒IIAccurate BiotechnologyAG21022
ABScript Neo RT预混液(含gDNA去除剂)ABclonalRK20433
2X通用SYBR Green快速qPCR预混液ABclonalRK21203
放射免疫沉淀分析缓冲液EpiZymePC101
BCA蛋白检测试剂盒EpiZymeZJ102
5X SDS-PAGE蛋白上样缓冲液EpiZymeLT103
PVDF膜EpiZymeWJ002
抗CD163抗体Proteintech16646-1-AP
抗β-肌动蛋白抗体Proteintech66009-1-IG
增强化学发光试剂EpiZymeSQ203

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
细胞培养与体外DN模型建立
HK-2细胞系来源、培养基组成(DMEM/F12、10% FBS、1%青霉素-链霉素)、培养条件(37°C、5% CO2)、高糖处理浓度(45 mM vs 17.5 mM)和处理时间(48小时)
阅读提示:Materials and methods 2.13 细胞培养与体外DN模型建立
RT-qPCR
RNA提取试剂盒、逆转录试剂盒、qPCR预混液、引物序列、反应条件和内参基因(β-actin)
阅读提示:Materials and methods 2.14 RNA提取和qRT-PCR;Table 1
Western blotting
一抗(CD163, β-actin)稀释比例、二抗孵育时间、蛋白上样量、曝光条件
阅读提示:Materials and methods 2.15 Western blotting
机器学习模型构建
MetaGSE划分比例(7:3)、交叉验证折数(10)、算法组合(SVM+Enet alpha=0.6)、lambda.min值(0.02732)、诊断基因列表
阅读提示:Materials and methods 2.7;Results 3.4