数据准备与清洗
构建用于模型开发和验证的干净数据集。
从PLCO试验中筛选参与者,排除不符合条件、失访、信息不完整或缺失的个体,最终纳入50,465名参与者,其中343例在10年内确诊卵巢癌。
Improving ovarian cancer risk assessment using a machine learning model developed on data from the Prostate Lung Colorectal Ovarian Cancer Screening Trial
本研究为基于PLCO队列数据的二次分析,主要涉及数据清洗、特征选择和模型构建,未包含体外或动物实验等实验验证。
PLCO筛查试验队列 PLCO对照组和干预组
模型训练集为PLCO对照组,验证集为干预组 纳入17个特征,包括年龄、BMI、生殖史等 模型超参数:14棵树,每棵树最多3层 风险阈值选择:58%基于训练集几何均值方法
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
构建用于模型开发和验证的干净数据集。
从PLCO试验中筛选参与者,排除不符合条件、失访、信息不完整或缺失的个体,最终纳入50,465名参与者,其中343例在10年内确诊卵巢癌。
选择与卵巢癌相关的预测因子并转换为适合模型输入的格式。
基于临床专家意见和统计分析,从58个特征中筛选出17个最终特征,并对连续变量进行最小-最大归一化,对分类变量进行独热编码。
开发并选择一个性能最佳的卵巢癌风险预测模型。
比较了Logistic回归、Cox比例风险模型、支持向量机和极端梯度提升(XGBoost)算法,最终选择XGBoost模型,并进行超参数调整和特征选择。
评估模型在验证集上的预测性能,并与现有模型进行比较。
计算模型的AUC、敏感性、特异性、阳性预测值和阴性预测值,并与Li等人的模型进行比较。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 模型开发 | Python | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据清洗 | 排除标准包括:不符合资格、失访、信息缺失等,具体比例需核对附录A图A.1。 阅读提示:Methods, Data cleaning; Appendix A Figure A.1 |
| 特征选择 | 保留的特征列表共17个,需查看附录A表A.4。 阅读提示:Methods, Results; Appendix A Table A.4 |
| 模型训练 | 训练集为PLCO对照组,验证集为干预组;模型参数为14棵树、每棵3层。 阅读提示:Methods, Results; Appendix A Figure A.3 |
| 模型评估 | 验证集上的AUC为0.66(95% CI: 0.64-0.68);最佳风险阈值58%基于训练集几何均值方法。 阅读提示:Results; Figure 1, Figure 3 |