数据预处理与质量控制
处理原始数据中的噪声和长尾分布,为生成建模提供干净数据。
采用LOF算法识别局部异常值并用中位数替换,对低频类别进行合并,以缓解高维稀疏性。
CLEO closed loop framework for synthesizing medical privacy preserving tabular data
包含GMM生成、Q学习优化、TSTR下游效用评估、DCR/NNAA隐私审计及消融实验等多个独立证据层级,并进行功能与机制验证。
颅内动脉瘤患者队列(1035例,多中心) GMM生成模型 Q-learning优化智能体
数据集划分:训练:验证:测试=80:10:10,分层抽样 GMM超参数搜索空间:K∈{5,10,…,30},max_iter∈{100,200,300},n_init∈{1,3,5} 强化学习设置:学习率α=0.1,折扣因子γ=0.95,探索衰减0.995,最小探索率0.01 TSTR评估:15个独立随机种子,AUC等指标 隐私审计:DCR和NNAA指标
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
处理原始数据中的噪声和长尾分布,为生成建模提供干净数据。
采用LOF算法识别局部异常值并用中位数替换,对低频类别进行合并,以缓解高维稀疏性。
利用清洁数据训练GMM,生成合成表格数据。
使用GMM对清洁数据进行密度估计,通过EM算法估计参数,并生成合成数据,再进行逆变换和生理范围后处理。
从统计保真度、下游效用和隐私风险三个维度评估合成数据质量。
计算KS、JS、TVD、相关性等保真度指标;采用TSTR范式评估效用;使用DCR和NNAA审计隐私。
根据评估反馈自适应调整GMM超参数,优化合成数据质量。
将合成过程形式化为MDP,使用Q-learning智能体探索超参数空间,更新Q表,迭代优化。
评估CLEO相对其他生成模型的性能,以及各模块的贡献。
与TVAE、CTGAN、Gaussian Copula比较;设置无反馈、无RL等变体进行消融实验。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 生成建模 | 高斯混合模型 | -- | -- |
| 数据预处理 | scikit-learn | -- | -- |
| 数据处理 | pandas | -- | -- |
| 模型实现 | Python 3.9 | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据预处理 | LOF邻居数为20,contamination='auto';类别合并阈值N<5 阅读提示:Methods: Data preprocessing and quality control |
| 数据划分 | 采用分层抽样,按80:10:10划分训练、验证、测试集,训练集828例、验证集103例、测试集104例 阅读提示:Methods: Data source and research task |
| GMM生成 | GMM参数:n_components∈{5,10,…,30},max_iter∈{100,200,300},n_init∈{1,3,5},covariance_type='full',random_state=42 阅读提示:Methods: The CLEO closed-loop synthesis framework; Table 7 |
| Q-learning优化 | 状态空间4维,动作空间54,学习率α=0.1,折扣因子γ=0.95,探索衰减0.995,最小探索率0.01,30个episode 阅读提示:Methods: The CLEO closed-loop synthesis framework; Table 8 |
| 效用评估 | TSTR评估使用15个独立随机种子,采用随机森林、梯度提升、XGBoost,评估AUC等指标 阅读提示:Methods: Implementation details and reproducibility; Results: Detailed downstream utility analysis |