暴露组全关联研究及阿尔茨海默病及相关痴呆发病的预测风险评分

Exposome-wide association study and predictive risk score for incident Alzheimer's disease and related dementias

作者信息Chenshuang Li, Chenxu Zhao, Yiqun Lan, Randall J Ellis, Shakson Isaac, Sai Zhang, Gary W Miller, Yi Sun, Shalini Jain, Hariom Yadav, Peng Gao, Chirag J Patel
PMID42811779
发布时间2026-10
DOI10.1002/alz.71842

实验完整度

中

基于UKB队列的ExWAS、XGBoost预测建模与ERS生存分析,以队列数据与机器学习验证为主,无独立机制实验。

主要模型

UK Biobank 499,992名参与者前瞻性队列 派生集(三分之二,n=333,328)与复制集(三分之一,n=166,664) XGBoost暴露组预测模型 暴露组风险评分(ERS)四分位分组

重点核对

暴露变量数量与领域:193种暴露,涵盖社会、物理、化学、生活方式、生态系统五个领域 Bonferroni校正阈值:p < 2.59 × 10−4(α = 0.05/193) Cox模型校正变量:基线年龄、性别、种族、APOE状态、总体健康和评估中心 预测模型验证:派生集训练,复制集内部验证,AUC、NRI、IDI ERS计算与分层:基于Cox回归β系数加权,四分位分组Q1–Q4

摘要

引言:环境暴露对阿尔茨海默病及相关痴呆(ADRD)有重要贡献,但系统评估多领域环境因素的综合暴露组全研究仍然有限,且缺乏精准医学应用价值。方法:我们在499,992名UK Biobank参与者中开展了暴露组全关联研究(ExWAS),检查了五个领域(社会、物理、化学、生活方式和生态系统)的193种暴露。采用Bonferroni校正的Cox比例风险模型识别与ADRD相关的暴露。我们使用XGBoost分类器构建预测模型,并进一步开发暴露组风险评分(ERS)用于风险分层。结果:在中位15.3年随访期间,8881名参与者(1.77%)发生ADRD,其中4000名为阿尔茨海默病。ExWAS在Bonferroni校正后识别出76种暴露。预测模型的曲线下面积(AUC)= 0.718,优于仅使用人口学+载脂蛋白E(APOE)状态(AUC = 0.678)。ERS对ADRD风险进行分层(最高与最低四分位风险比[HR] = 2.97,95%置信区间[CI]:2.59–3.41)。讨论:ERS有潜力为ADRD的临床相关预防策略做出贡献。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
能否通过暴露组全关联研究系统识别与ADRD和AD发病相关的多领域环境暴露,并构建预测模型和暴露组风险评分用于人群风险分层?
核心机制
多种可改变的环境暴露(如用药数量、生活方式、空气污染、社会因素)通过多维交互共同影响ADRD风险;文献提出睡眠紊乱影响淀粉样蛋白清除、体力活动具有保护作用等可能机制,但主要为关联性证据。
主要证据
在499,992名UKB参与者中,ExWAS识别出76种与ADRD显著相关的暴露(34种与AD相关);XGBoost预测模型AUC=0.718,优于人口学+APOE模型(AUC=0.678);ERS最高与最低四分位HR=2.97(95% CI:2.59–3.41)。
研究意义
暴露组风险评分有潜力为ADRD的临床相关预防策略做出贡献,支持开发针对可改变暴露的多组分干预策略以减轻痴呆负担。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

研究人群构建与随访

建立无基线ADRD的前瞻性队列,用于暴露与ADRD关联分析。

从UKB 502,414名参与者中排除基线ADRD或无随访记录者,纳入499,992人;随机分为派生集(三分之二)和复制集(三分之一),随访至2024年7月。

2

暴露组变量选取与处理

构建涵盖多领域的暴露组变量集,用于ExWAS分析。

从UKB非遗传暴露变量中排除缺失>20%者,保留12个缺失20%–30%的关键生活方式和饮食变量,最终纳入193个基线或衍生变量,归为社会、物理、化学、生活方式、生态系统五类。

3

ExWAS关联分析

系统识别与ADRD和AD发病相关的暴露。

对每个基线暴露运行Cox比例风险模型,校正基线年龄、性别、种族、APOE状态、总体健康和评估中心,采用Bonferroni校正定义显著关联。

4

暴露组预测模型构建

基于ExWAS识别暴露构建ADRD和AD预测模型并验证。

以ExWAS显著暴露为候选特征,Spearman秩相关处理多重共线性;派生集训练,复制集验证;采用XGBoost算法,GridSearchCV优化超参数,嵌套交叉验证,LASSO特征选择,ROC AUC评估。

5

特征重要性与交互分析

解释模型预测因素并识别暴露间协同效应。

采用SHAP分析解释最优模型中预测特征的贡献;对前10个特征进行SHAP交互分析,采样500个观测计算成对SHAP交互值,用SHAP依赖图可视化最强交互。

6

暴露组风险评分构建与生存分析

构建ERS用于人群风险分层并评估其与ADRD发病的关联。

以最终XGBoost模型保留的重要暴露为特征,按Cox回归β系数加权求和计算ERS;按ERS四分位分组,构建Kaplan–Meier生存曲线,Cox模型评估ERS四分位与ADRD发病关联。

7

亚组分析

评估暴露关联和ERS在不同人口学与遗传亚组中的异质性。

按基线年龄(<65和≥65岁)、性别(女性和男性)、遗传风险(低、中、高,基于APOE基因型)和种族(White British和其他)进行亚组分析。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
研究人群与分组
纳入排除标准、派生集与复制集划分比例(2:1)、随访起止时间与中位随访时长
阅读提示:Methods 2.1 Study population;Figure S1
暴露组变量处理
193个暴露变量的领域分类、缺失数据插补策略(<5%简单插补,≥5% missRanger,k=3)、连续变量标准化
阅读提示:Methods 2.3 Exposome variables;Table S2;Figure S2
ExWAS关联分析
Cox模型校正变量(年龄、性别、种族、APOE、总体健康、评估中心)、Bonferroni阈值p < 2.59 × 10−4、比例风险假设检验与时间交互项
阅读提示:Methods 2.4.1;Tables S7, S8, S9
预测模型构建与验证
XGBoost超参数搜索范围、嵌套交叉验证折数、LASSO特征选择、下采样策略、AUC与NRI/IDI计算方式
阅读提示:Methods 2.4.2;Table S12;Figure 4
ERS构建与生存分析
ERS加权系数来源(Cox回归β系数)、四分位分组、Kaplan–Meier曲线与Cox模型校正变量、HR参照组
阅读提示:Methods 2.4.3;Figure 6;Figure S5
亚组分析
年龄、性别、APOE遗传风险、种族的亚组划分标准与各亚组样本量
阅读提示:Methods 2.4.4;Tables S6, S10, S11;Figure 3