数据获取与预处理
获取全国人口普查区层面的社会、环境和健康数据,并进行标准化和缺失值处理。
使用2022年CDC环境正义指数(EJI)数据库,包含社会、环境和健康结果变量,对数据进行标准化并处理缺失值。
Predicting Asthma Prevalence Across U.S. Communities by Integrating Social Vulnerability and Environmental Risk with Machine Learning
本研究为基于人口普查区数据的横断面生态分析,使用K-means聚类和随机森林模型,未包含实验验证或功能验证,属于观察性分析。
美国人口普查区 美国社区(基于2010年人口普查区边界)
基于2022年CDC环境正义指数(EJI)数据库,包含人口普查区层面的社会和环境变量 K-means聚类中输入特征包括哮喘率、高血压率、癌症率、心理健康不良率和糖尿病率,k=9 随机森林模型按80/20比例随机划分训练集和测试集,超参数通过3折交叉验证的随机搜索优化 使用置换重要性(50次重复)评估特征对R2的贡献,并用SHAP分析(500个普查区样本)探索预测因子贡献
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
获取全国人口普查区层面的社会、环境和健康数据,并进行标准化和缺失值处理。
使用2022年CDC环境正义指数(EJI)数据库,包含社会、环境和健康结果变量,对数据进行标准化并处理缺失值。
基于哮喘患病率和相关健康结果,识别具有不同健康负担模式的地理聚类。
使用K-means聚类(k=9),输入特征包括哮喘率、高血压率、癌症率、心理健康不良率和糖尿病率;通过肘部法确定最佳k值,使用t-SNE可视化聚类。
将聚类映射到地理区域,并比较高、低哮喘患病率组的社会、环境、健康特征差异。
将聚类映射到2010年美国人口普查区边界,使用ArcGIS Pro创建全国热力图;使用Mann-Whitney U检验比较高、低患病率组的社会和环境变量,并进行Benjamini-Hochberg多重比较校正。
评估社会和环境因素预测哮喘患病率的能力,并识别重要预测因子。
训练随机森林回归模型,使用社会和环境变量预测哮喘率;随机划分训练集(80%)和测试集(20%);使用3折交叉验证的随机搜索优化超参数;使用置换重要性(50次重复)评估特征重要性;与单变量线性回归比较。
探索预测因子贡献如何随社会经济背景(以贫困率为指标)变化。
基于训练好的随机森林模型,计算SHAP值(使用500个普查区随机样本和100个普查区背景样本),并计算每个预测因子的SHAP值与贫困率之间的Pearson相关。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 地理分析 | ArcGIS Pro | -- | -- |
| 机器学习建模 | scikit-learn | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据来源 | 使用2022年CDC环境正义指数(EJI)数据库,包含人口普查区层面的社会、环境和健康指标 阅读提示:Methods部分,Data and Preprocessing |
| 聚类分析 | K-means聚类输入特征(哮喘率、高血压率、癌症率、心理健康不良率、糖尿病率)及聚类数k=9,基于肘部法确定 阅读提示:Methods部分,Clustering Analysis |
| 随机森林模型 | 训练集和测试集划分比例(80/20),超参数优化策略(随机搜索,3折交叉验证),置换重要性重复次数(50次) 阅读提示:Methods部分,Machine Learning Model |
| SHAP分析 | SHAP值计算的样本量(随机500个普查区,背景样本100个),计算SHAP值与贫困率的Pearson相关 阅读提示:Methods部分,Machine Learning Model |
| 统计比较 | 使用双侧Mann-Whitney U检验,并采用Benjamini-Hochberg校正多重比较(按变量类别) 阅读提示:Methods部分,Statistical Analysis |