基于英国生物银行血浆蛋白质组学的机器学习驱动的冠心病风险预测
Machine Learning-Driven Prediction of Coronary Artery Disease Risk Based on UK Biobank Plasma Proteomics
背景:冠心病是全球主要的死亡原因,但传统风险模型的预测准确性有限。本研究整合了传统风险因素、多基因风险评分和大规模蛋白质组学数据,旨在开发一个统一的模型以增强冠心病风险预测。方法:使用英国生物银行的数据,纳入具有血浆蛋白质组学和遗传风险数据的参与者,并排除已确诊的冠心病患者。来自英格兰的参与者被分为训练集(n=32,330)和内部验证集(n=13,857),来自苏格兰/威尔士的参与者构成外部验证集(n=5,775)。通过关联健康记录确定新发冠心病事件。通过最小绝对收缩和选择算子(LASSO)Cox回归推导出包含202个蛋白质的蛋白质组学风险评分,并使用CatBoost模型分别训练仅包含传统风险因素、以及逐步加入多基因风险评分和蛋白质组学风险评分的模型;通过SHapley Additive exPlanations引导的前向选择确定了一个紧凑的蛋白质组合。结果:在所有队列中,中位年龄为58岁,约45%为男性。蛋白质组学风险评分与冠心病风险呈剂量依赖性相关。与仅使用传统风险因素相比,整合多基因风险评分和蛋白质组学风险评分改善了模型的区分度,内部验证的曲线下面积从0.750(95% CI, 0.732-0.767)提高到0.789(95% CI, 0.772-0.805),外部验证则从0.717(95% CI, 0.683-0.750)提高到0.762(95% CI, 0.732-0.791)。一个包含9个蛋白质的组合(GDF15、MMP12、NPPB、PGF、REN、ADGRG2、ACE2、CDCP1、CXCL17)捕获了大部分蛋白质组学预测信息。结论:我们的研究结果表明,整合传统风险因素、多基因风险评分和蛋白质组学数据可以改善冠心病风险预测。本研究突出了蛋白质组学在精准心血管医学和简化风险分层工具中的应用价值。