数据获取与队列构建
利用NHIS-LC队列数据,构建2019-2020年纵向随访的分析样本,以预测HICP状态变化。
从NHIS-LC获取2019-2020年成人数据,筛选出在2019年和2020年均有有效HICP信息的10,260名成年人,分为新发HICP、持续HICP、恢复HICP和无HICP四组。
Predicting the course of high-impact chronic pain using machine learning algorithms
基于2019-2020年NHIS纵向队列的观察性队列研究,使用机器学习进行预测建模,包含描述性统计和模型性能评估,但无干预或机制验证。
全国健康访谈调查纵向队列(NHIS-LC)
2019-2020年NHIS-LC成人队列,基线2019年,随访2020年 HICP分类定义:过去三个月多数天数或每天疼痛且限制生活或工作活动 机器学习模型:GBDT,80%训练集和20%测试集,5折交叉验证 特征处理:缺失值>30%剔除,≤30%用中位数或众数填补 类别不平衡处理:训练时应用类别加权
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
利用NHIS-LC队列数据,构建2019-2020年纵向随访的分析样本,以预测HICP状态变化。
从NHIS-LC获取2019-2020年成人数据,筛选出在2019年和2020年均有有效HICP信息的10,260名成年人,分为新发HICP、持续HICP、恢复HICP和无HICP四组。
准备50个生物心理社会预测变量,并处理缺失数据,以用于机器学习模型。
从2019年NHIS-LC数据中提取人口统计学、地理、身体健康、心理健康和社会经济地位的50个特征,排除缺失超过30%的变量,对剩余缺失值使用中位数或众数填补。
训练和评估多个机器学习算法(如GBDT、RF、DNN、LR)以预测HICP组别,并比较它们的性能。
使用H2O AutoML自动进行模型选择、训练和超参数调整,数据集随机分为80%训练集和20%测试集,在训练集内进行5折交叉验证,在测试集上评估模型性能,并应用类别加权处理类别不平衡。
使用SHAP值解释模型预测,识别对HICP各结局预测最重要的特征。
使用KernelExplainer计算SHAP值,K均值聚类(K=100)生成背景样本,计算每个特征的平均绝对SHAP值,并按SHAP值排序展示特征重要性。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 机器学习建模 | H2O AutoML | -- | -- |
| Python 3.8 | -- | -- | |
| PyTorch 1.10 | -- | -- | |
| H2O 3.42 | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据获取 | NHIS-LC队列的2019-2020年数据,样本量为10,260,排除缺失HICP数据的个体 阅读提示:Methods - Data 部分 |
| 特征定义 | 50个生物心理社会特征,包括人口统计学、地理、身体健康、心理健康和社会经济地位 阅读提示:Methods - Features 部分,Table 1 |
| 数据预处理 | 缺失数据>30%的变量被排除,≤30%的缺失值用中位数或众数填补 阅读提示:Methods - Data curation 部分 |
| 模型训练 | 训练集80%,测试集20%,H2O AutoML进行5折交叉验证和超参数调整,类别加权处理类别不平衡 阅读提示:Methods - Modeling algorithms and evaluation 部分 |
| 模型评估 | 评估指标:宏平均AUC、F1得分、准确率,以及类别特异性指标 阅读提示:Methods - Modeling algorithms and evaluation,Supplemental Tables 2, 3 |
| 模型解释 | SHAP值计算使用KernelExplainer,K均值聚类(K=100)生成背景样本 阅读提示:Methods - Model interpretation 部分 |