构建纵向队列与风险区间
构建新发无牙症的纵向分析样本,以识别从有牙到全口无牙的转变。
从CHARLS 2011-2018年数据中筛选有牙齿状态信息且后续随访的参与者,构建风险人-时间区间,排除已有无牙症者,最终纳入43,478个风险区间和2251例事件。
Beyond Ageing: Spatial and Social Inequalities in Incident Edentulism Among Older Chinese Adults
研究基于大规模纵向队列数据,结合空间自相关、机器学习建模与SHAP解释及多因素回归,证据层级较多,但缺乏体外或动物模型等实验验证。
中国健康与养老追踪调查(CHARLS)纵向队列 城市级空间单元
新发无牙症的定义:由有牙到全口无牙的转变,基于自我报告 分析单元:风险人-时间区间,排除已有无牙症个体 模型验证:训练集、内部测试集、时间验证集及严格新参与者时间子集 主要预测因素:年龄、教育、户口、BMI、残疾、IADL限制等 统计方法:逻辑回归使用聚类稳健标准误,以人水平聚类
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
构建新发无牙症的纵向分析样本,以识别从有牙到全口无牙的转变。
从CHARLS 2011-2018年数据中筛选有牙齿状态信息且后续随访的参与者,构建风险人-时间区间,排除已有无牙症者,最终纳入43,478个风险区间和2251例事件。
描述样本基线特征并比较不同数据子集及事件组间的差异。
计算计数和百分比,使用卡方检验或Fisher精确检验比较训练集、内部测试集和时间验证集以及事件组和非事件组的特征分布。
描述无牙症的空间分布并检验空间聚集性。
将个体数据聚合到省和城市层面,计算患病比例和新发比例,绘制主题图和双变量背景图,计算全局和局部莫兰指数。
选择关键预测因素并比较不同机器学习模型的性能。
在训练集内使用组感知递归特征消除进行特征选择,训练多种模型(逻辑回归、SVM、随机森林、Extra Trees、GBDT、AdaBoost、XGBoost、LightGBM),并在内部测试集和时间验证集评估性能。
解释XGBoost模型的预测,量化各特征的贡献及交互作用。
使用SHAP值计算全局特征重要性,绘制蜂群图和依赖图,分解城市背景特征的主效应和交互效应,并通过自助采样评估排名稳定性。
将模型选中的预测因素转化为可解释的不平等对比组,估计粗和调整后的不平等指标。
根据选中预测因素定义参考组和比较组,计算风险差和风险比,并使用多变量逻辑回归估计调整后的比值比,标准误按人聚类。
按研究目的归类文中使用的方法,便于定位所需技术。
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据来源 | 使用CHARLS 2011-2018年数据,纳入年龄≥45岁且牙齿状态非缺失者 阅读提示:Methods: Data source and study population |
| 结果定义 | 新发无牙症定义为从有牙到全口无牙的转变,基于自我报告。 阅读提示:Methods: Outcome and candidate predictors |
| 分析单元 | 风险人-时间区间,排除已有无牙症者,事件发生后移出后续风险集。 阅读提示:Methods: Data source and study population |
| 模型验证 | 训练集、内部测试集、时间验证集及严格新参与者时间子集;训练-测试按参与者水平分割。 阅读提示:Methods: Model development and validation |
| 统计方法 | 多变量逻辑回归中标准误按人聚类。 阅读提示:Methods: Adjusted inequality estimates |