通过整合社会脆弱性与环境风险及机器学习预测美国社区哮喘患病率

Predicting Asthma Prevalence Across U.S. Communities by Integrating Social Vulnerability and Environmental Risk with Machine Learning

作者信息Thinh H Nguyen, Saleh Alsulami, Teresia T Pham, Diane Story, Marissa Hauptman, Wanda Phipatanakul
PMID42066916
发布时间2026-04-29
DOI10.1016/j.jaci.2026.04.015

实验完整度

本研究为基于人口普查区数据的横断面生态分析,使用K-means聚类和随机森林模型,未包含实验验证或功能验证,属于观察性分析。

主要模型

美国人口普查区 美国社区(基于2010年人口普查区边界)

重点核对

基于2022年CDC环境正义指数(EJI)数据库,包含人口普查区层面的社会和环境变量 K-means聚类中输入特征包括哮喘率、高血压率、癌症率、心理健康不良率和糖尿病率,k=9 随机森林模型按80/20比例随机划分训练集和测试集,超参数通过3折交叉验证的随机搜索优化 使用置换重要性(50次重复)评估特征对R2的贡献,并用SHAP分析(500个普查区样本)探索预测因子贡献

摘要

背景:哮喘是美国最常见的慢性病之一,对种族和族裔少数群体以及低收入社区的影响尤为严重。虽然社会和环境因素都被认为是哮喘患病率的已知促成因素,但它们相互作用形成地理差异的程度仍未得到充分理解。目标:本研究旨在探讨这些因素在哮喘患病率不同的地区之间如何变化,以识别可能为有针对性的公共卫生应对措施提供信息的模式。方法:我们使用了美国疾病控制与预防中心的2022年环境正义指数(EJI),该指数包括人口普查区层面的标准化社会和环境测量指标。K均值聚类根据哮喘患病率及相关健康结果识别了具有不同哮喘患病率的地理聚类。训练了一个随机森林模型,使用社会和环境变量预测哮喘患病率,并分析了特征重要性。结果:我们识别出九个聚类,其中三个聚类显示最高的哮喘患病率。高患病率地区表现出更大的社会脆弱性,包括更高的贫困率、少数族裔人口比例、英语水平有限、失业和住房成本负担。这些地区还承受更大的环境暴露,如PM2.5、臭氧、柴油污染升高,以及更多靠近危险废物场地、化学设施和老旧住房的土地。随机森林模型预测哮喘患病率具有较强的预测性能(R2 = 0.81)。社会经济变量始终比环境暴露排名为更强的预测因子。结论:高哮喘患病率的地理区域是由社会和环境的脆弱性重叠所塑造的。社会经济差异尤为突出。这些发现支持采取综合的、数据驱动的公共卫生策略来解决哮喘不平等问题。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
社会和环境因素如何相互作用,并塑造美国不同地理区域哮喘患病率的差异?
核心机制
社会经济因素(如贫困率、英语水平有限、少数族裔比例)和环境暴露(如PM2.5、臭氧、柴油污染)共同预测哮喘患病率,但社会经济因素的作用更强;社会和环境因素可能通过复杂交互作用影响哮喘,而非简单的单变量关联。
主要证据
基于CDC EJI数据库的人口普查区数据,K-means聚类确定了9个聚类,其中3个为高哮喘患病率聚类;随机森林模型预测哮喘率R2=0.81,置换重要性显示贫困率、英语水平有限和少数族裔比例是最重要的预测因子;SHAP分析显示社会脆弱性指标在贫困率高的地区贡献更大。
研究意义
研究结果支持综合的、数据驱动的公共卫生策略,强调需要同时解决环境暴露和社会不平等问题,以更公平地分配资源和针对性干预。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

数据获取与预处理

获取全国人口普查区层面的社会、环境和健康数据,并进行标准化和缺失值处理。

使用2022年CDC环境正义指数(EJI)数据库,包含社会、环境和健康结果变量,对数据进行标准化并处理缺失值。

2

K-means聚类分析

基于哮喘患病率和相关健康结果,识别具有不同健康负担模式的地理聚类。

使用K-means聚类(k=9),输入特征包括哮喘率、高血压率、癌症率、心理健康不良率和糖尿病率;通过肘部法确定最佳k值,使用t-SNE可视化聚类。

3

地理映射和组间比较

将聚类映射到地理区域,并比较高、低哮喘患病率组的社会、环境、健康特征差异。

将聚类映射到2010年美国人口普查区边界,使用ArcGIS Pro创建全国热力图;使用Mann-Whitney U检验比较高、低患病率组的社会和环境变量,并进行Benjamini-Hochberg多重比较校正。

4

随机森林模型预测

评估社会和环境因素预测哮喘患病率的能力,并识别重要预测因子。

训练随机森林回归模型,使用社会和环境变量预测哮喘率;随机划分训练集(80%)和测试集(20%);使用3折交叉验证的随机搜索优化超参数;使用置换重要性(50次重复)评估特征重要性;与单变量线性回归比较。

5

SHAP分析

探索预测因子贡献如何随社会经济背景(以贫困率为指标)变化。

基于训练好的随机森林模型,计算SHAP值(使用500个普查区随机样本和100个普查区背景样本),并计算每个预测因子的SHAP值与贫困率之间的Pearson相关。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
ArcGIS Pro----
scikit-learn----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据来源
使用2022年CDC环境正义指数(EJI)数据库,包含人口普查区层面的社会、环境和健康指标
阅读提示:Methods部分,Data and Preprocessing
聚类分析
K-means聚类输入特征(哮喘率、高血压率、癌症率、心理健康不良率、糖尿病率)及聚类数k=9,基于肘部法确定
阅读提示:Methods部分,Clustering Analysis
随机森林模型
训练集和测试集划分比例(80/20),超参数优化策略(随机搜索,3折交叉验证),置换重要性重复次数(50次)
阅读提示:Methods部分,Machine Learning Model
SHAP分析
SHAP值计算的样本量(随机500个普查区,背景样本100个),计算SHAP值与贫困率的Pearson相关
阅读提示:Methods部分,Machine Learning Model
统计比较
使用双侧Mann-Whitney U检验,并采用Benjamini-Hochberg校正多重比较(按变量类别)
阅读提示:Methods部分,Statistical Analysis