基于机器学习策略识别脑脊液中阿尔茨海默病的稳健蛋白生物标志物组合

Machine-learning based strategy identifies a robust protein biomarker panel for Alzheimer's disease in cerebrospinal fluid.

作者信息Xiaosen Hou, Yunjie Qiu, Hui Li, Yan Yan, Dongxu Zhao, Simei Ji, Junjun Ni, Jun Zhang, Kefu Liu, Hong Qing, Zhenzhen Quan
PMID40616179
发布时间2025-07-04
DOI10.1186/s13195-025-01789-5

实验完整度

研究基于多个公开蛋白质组学数据集进行二次分析,通过机器学习构建诊断模型,并利用ELISA验证三个蛋白,但缺乏湿实验机制验证,且样本重叠可能引入偏倚。

主要模型

脑脊液蛋白质组学数据集 脑组织蛋白质组学数据集 临床脑脊液样本

重点核对

12蛋白组合的具体蛋白列表包括YWHAZ、LDHA、PKM、CHI3L1、BASP1、SMOC1、ENO2、PRDX1、VSTM2A、F2、SOD1、FN1 训练集和验证集:297_CSF用于训练,其他数据集用于验证 模型评估指标:准确率、AUC、混淆矩阵 ELISA验证:使用6例AD、6例MCI和6例正常对照的CSF样本,检测BASP1、SMOC1和FN1 数据集样本量:各队列样本量不同,如297_CSF有297例,114_CSF有114例等

摘要

背景:阿尔茨海默病(AD)的复杂发病机制导致目前用于其分类和诊断的生物标志物有限,因此需要进一步研究可靠的通用生物标志物或其组合。方法:在这项工作中,我们收集了多个脑脊液蛋白质组学数据集,并通过SVM-RFECV方法结合等样本量和标准归一化设计构建了一个通用诊断模型。该模型在297_CSF中训练,然后在其他数据集中测试效果。结果:利用机器学习,我们从脑脊液蛋白质组数据集中识别出一个12蛋白组合。通用诊断模型在来自不同国家和不同检测技术的十个不同AD队列中表现出强大的诊断能力和高准确性。这些蛋白参与多种与AD相关的生物过程,并与已建立的AD致病生物标志物(包括淀粉样蛋白-β、tau/p-tau和蒙特利尔认知评估评分)密切相关。模型的高准确性可能归因于基于全面发病机制和不同AD进展的多蛋白组合。此外,它能有效区分AD与轻度认知障碍(MCI)及其他神经退行性疾病,尤其是与AD具有相似发病机制的额颞叶痴呆(FTD)。结论:这项研究强调了一个高准确性、稳健性和兼容性的12蛋白组合模型,其检测甚至可基于无标记、TMT和DIA质谱或ELISA技术,暗示其在临床应用中的潜在前景。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
如何利用机器学习方法从脑脊液蛋白质组数据中识别出稳健且通用的阿尔茨海默病生物标志物组合?
核心机制
12蛋白组合中的蛋白质涉及能量代谢、炎症、抗氧化和突触相关功能,反映AD的异质性发病机制,并与经典生物标志物Aβ42和tau相关。
主要证据
基于SVM-RFECV算法,在297_CSF队列中构建模型,准确率92%,AUC=0.96,并在多个独立队列中验证,AUC范围0.80-0.97;ELISA验证SMOC1、BASP1和FN1的表达变化;与经典AD标志物显著相关。
研究意义
12蛋白组合模型具有高准确性和跨技术兼容性,有望在临床应用中用于AD诊断。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

差异表达蛋白筛选

识别在不同脑脊液蛋白质组数据集中稳健变化的蛋白作为候选生物标志物。

对297_CSF和114_CSF数据集进行差异表达分析,筛选重叠的差异表达蛋白,经过去除方向相反的蛋白后获得70种稳健DEPs。

2

SVM-RFECV特征选择

利用机器学习算法从候选蛋白中筛选出最优的蛋白组合用于AD分类。

基于70个稳健DEPs,在297_CSF队列中使用SVM-RFECV方法进行特征选择,通过5折交叉验证选择AUC最大的12个蛋白组合。

3

模型性能评估

评估12蛋白组合模型在训练集和独立验证集中的诊断性能。

使用混淆矩阵、准确率和AUC评估模型在297_CSF及6个独立数据集(36_CSF、39_CSF、114_CSF、120_CSF、55_CSF、300_CSF)中的表现,并验证其对其他神经退行性疾病的区分能力。

4

相关性分析

分析12蛋白组合与经典AD生物标志物的相关性,验证其临床相关性。

使用12个蛋白的第一主成分(PC1)与经典AD标志物(Aβ42、tau、p-tau)及MoCA评分进行Pearson相关分析,并进行meta分析。

5

跨技术平台验证

验证12蛋白组合在不同检测技术(SomaScan、PEA、ELISA)中的预测性能。

使用SomaScan和PEA数据集评估模型预测性能,并采用ELISA检测BASP1、SMOC1和FN1在AD、MCI和正常对照中的表达。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
BASP1 ELISA试剂盒FineTestEH4068
SMOC1 ELISA试剂盒CUSABIOCSB-EL021842HU
FN1 ELISA试剂盒ElabscienceE-EL-H0179

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
差异表达蛋白筛选
数据集:297_CSF和114_CSF;样本量:297_CSF(147对照,150AD)、114_CSF(59对照,55AD);差异表达阈值:P<0.05;缺失值过滤:删除缺失超过80%的蛋白
阅读提示:Methods: Data preprocessing, Identification of DEPs
SVM-RFECV特征选择
算法:SVM-RFECV;交叉验证:5折;候选蛋白数:70个稳健DEPs;训练集:297_CSF;选择标准:最大AUC
阅读提示:Methods: The prioritization of biomarker combinations by SVM-RFECV; Figure 2A
模型性能评估
验证集:36_CSF、39_CSF、114_CSF、120_CSF、55_CSF、300_CSF;评估指标:准确率、AUC、混淆矩阵;额外验证集:Muti_disease_CSF(AD、FTD、PD、ALS)
阅读提示:Results: ML-based detection of biomarker combinations; Figure 2F-G, H
ELISA验证
样本量:每组6例(AD、MCI、正常对照);检测蛋白:BASP1、SMOC1、FN1;样本来源:宣武医院;模型训练数据:297_CSF
阅读提示:Methods: ELISA test; Table 3
交叉技术验证
数据集:296_CSF(SomaScan)、425_CSF(PEA);评估指标:AUC
阅读提示:Results: Core proteins from the panel show robust prediction performance cross technologies; Figure 5B