研究人群与结局定义
建立无ADRD基线队列并定义新发ADRD结局,以进行后续预测建模。
从UKB约500,000参与者中筛选具有完整遗传、蛋白质组、代谢组和临床生物标志物数据的个体,排除基线前神经系统疾病、非欧洲 ancestry、亲缘关系和缺失数据者;ADRD结局基于ICD-10编码从住院和死亡登记记录中确定。
Integrative prediction of Alzheimer's disease and related dementias using multi-omics aging clocks and genetic data
UKB队列+多组学衰老时钟建模,TwinGene外部验证,含功能分层与竞争风险验证
UK Biobank队列(N=16,215,无ADRD基线) TwinGene队列(N=3,772;331例ADRD) ProtAge蛋白质组衰老时钟 MetaboAge代谢组衰老时钟
UKB与TwinGene中ADRD PRS均使用Jansen phase-1效应量加权,UKB含80个SNP,TwinGene可用SNP为73个 ProtAge和MetaboAge时钟在训练集内通过五折交叉验证构建,并在留出测试集评估 完全整合模型(Model 5)在UKB留出测试集AUC=0.90、AUPRC=0.24;TwinGene外部验证AUC=0.757、AUPRC=0.223 Fine–Gray竞争风险模型以死亡为竞争事件,高风险组(最高25%)vs低风险组sHR=16.73(95%CI:6.49–43.11) 敏感性分析涵盖性别、发病年龄、APOE分层、PRS含/不含APOE、是否含生活方式、随访时间、缺失数据处理及100次重复分层70/30划分
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
建立无ADRD基线队列并定义新发ADRD结局,以进行后续预测建模。
从UKB约500,000参与者中筛选具有完整遗传、蛋白质组、代谢组和临床生物标志物数据的个体,排除基线前神经系统疾病、非欧洲 ancestry、亲缘关系和缺失数据者;ADRD结局基于ICD-10编码从住院和死亡登记记录中确定。
量化ADRD遗传风险,作为预测模型的遗传组分。
基于Bellenguez et al. (2022)报道的83个全基因组显著先导SNP,限制为80个LD独立SNP(含APOE位点),使用Jansen phase-1效应量加权;采用深度数据驱动机器学习(DDML)贝叶斯变分自编码器在UKB 276,566名无亲缘关系欧洲 ancestry个体中训练。
获取临床和端粒相关的生物学衰老测量,作为预测模型的衰老组分。
在325,870名具有18种生物标志物完整数据的UKB参与者中,使用KDM、PhenoAge和HD计算生物学年龄;按Rockwood缺陷累积模型计算FI;使用UKB相对白细胞端粒长度(调整技术参数)。
构建基于代谢组的生物学衰老时钟,预测实际年龄以用于ADRD预测。
使用UKB Nightingale NMR代谢组学数据(Phase 2),筛选184个NMR代谢特征,经Box–Cox变换和KNN插补(k=9),以Mahalanobis距离检测异常值;采用堆叠集成模型(XGBoost、LightGBM、CatBoost为基学习器,Elastic-Net alpha=0.5为元学习器)预测实际年龄,分性别建模;在ADRD分析队列训练集内五折交叉验证训练。
构建基于蛋白质组的生物学衰老时钟,预测实际年龄以用于ADRD预测。
使用50,482名UKB参与者的Olink平台NPX数据(2937种蛋白质检测),经KNN插补(k=9)和Isolation Forest异常值排除;采用与MetaboAge相同的堆叠集成模型预测实际年龄,分性别建模;在ADRD分析队列训练集内五折交叉验证训练。
评估逐步添加遗传、临床衰老、蛋白质组和代谢组预测因子对ADRD区分度的增量价值。
将ADRD分析队列按ADRD状态、性别和基线年龄分箱(5年)分层随机分为70%训练集和30%留出测试集;在训练集内五折交叉验证训练XGBoost分类器;逐步添加预测因子构建Base至Model 5,在留出测试集评估AUC、AUPRC和校准。
在考虑死亡竞争风险下估计绝对ADRD风险和风险分层。
使用最终整合预测因子集(Model 5)拟合Fine–Gray竞争风险回归,以死亡为竞争事件,估计5年和9年绝对ADRD风险;按预测风险分为高风险(最高25%)和低风险(最低75%)组,计算sHR和累积发病率曲线。
评估整合ADRD预测框架在独立队列中的外部可迁移性和方法学重复性。
在TwinGene瑞典双生子队列中,将预测因子尽可能与UKB Model 5结构协调一致,使用相同SNP panel和Jansen phase-1权重(73个SNP可用),临床衰老指标采用协调的PhenoAge、FI和TL;使用队列训练的Olink ProtAge复制和UKB可移植重校准MetaboAge变量;评估ROC-AUC、AUPRC和竞争风险风险分层。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 遗传分型 | UK Biobank Axiom芯片 | Affymetrix/Applied Biosystems | -- |
| UK BiLEVE Axiom芯片 | Affymetrix/Applied Biosystems | -- | |
| 代谢组学 | Nightingale NMR代谢组学平台 | Nightingale Health Ltd. | -- |
| 蛋白质组学 | Olink平台 | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 研究人群与ADRD结局判定 | UKB分析样本量N=16,215、中位随访10.08年、397例新发ADRD;ADRD基于ICD-10编码从住院和死亡登记确定;排除基线前神经系统疾病、非欧洲 ancestry、亲缘关系和缺失数据者。 阅读提示:Methods 2.1 Study design and population;Methods 2.7 ADRD;Table 1 |
| ADRD PRS构建 | PRS SNP panel为80个LD独立SNP(含APOE位点);使用Jansen phase-1效应量加权;DDML贝叶斯变分自编码器架构(三层编码器512→256→128,对称解码器,50维潜在空间);训练100 epochs,Adam优化器(学习率=0.001,batch size=256);训练集为276,566名无亲缘关系欧洲 ancestry UKB个体。 阅读提示:Methods 2.2 Genetic data;Methods 2.3 PRS |
| ProtAge和MetaboAge衰老时钟构建 | MetaboAge使用184个NMR代谢特征(UKB Nightingale Phase 2,QC后228,513人);ProtAge使用2,937种Olink蛋白检测(50,482人);两者均经KNN插补(k=9),MetaboAge用Mahalanobis距离、ProtAge用Isolation Forest检测异常值;堆叠集成模型(XGBoost、LightGBM、CatBoost + Elastic-Net alpha=0.5),分性别训练,训练集内五折交叉验证。 阅读提示:Methods 2.5 Metabolomic aging clock;Methods 2.6 Proteomic aging clock |
| 多变量预测模型与评估 | 70/30分层训练-测试划分(按ADRD状态、性别、基线年龄5年分箱);训练集N=11,351(275例ADRD),测试集N=4,864(122例ADRD);逐步模型Base至Model 5的预测因子组成;XGBoost分类器在训练集内五折交叉验证;模型调整基线年龄、性别、BMI、饮酒频率、吸烟状态、教育水平和前10个遗传主成分。 阅读提示:Methods 2.9 Predictive models;Methods 2.11 Statistical analysis;Table 2 |
| 竞争风险分析与风险分层 | Fine–Gray竞争风险回归以死亡为竞争事件;预测5年和9年绝对ADRD风险;风险分层为最高25% vs 最低75%;时间尺度为自基线评估天数;sHR=16.73(95%CI:6.49–43.11)为高风险组vs低风险组。 阅读提示:Methods 2.10 Survival analysis and composite risk stratification;Figure 5 |
| TwinGene外部验证 | TwinGene完整病例N=3,772,331例新发ADRD,841例竞争死亡事件;PRS可用73个SNP;临床衰老协调为PhenoAge、FI、TL;ProtAge为队列训练Olink复制,MetaboAge为UKB可移植重校准变量;50次重复分层70/30划分评估ROC-AUC和AUPRC;五折out-of-fold分析。 阅读提示:Methods 2.10.1 External validation and replication in TwinGene;Results 3.7 External validation in TwinGene;Table S10–S12 |