CLEO闭环框架用于合成医学隐私保护表格数据

CLEO closed loop framework for synthesizing medical privacy preserving tabular data

作者信息Siqi Wang, Jianfeng Wang, Xiaochun Cheng, Wei Zhang, Yuan Tian, Ma Ning, Fangwei Li, Yuxin Liu
PMID42448813
发布时间2026-07-14
DOI10.1038/s41746-026-02999-3

实验完整度

包含GMM生成、Q学习优化、TSTR下游效用评估、DCR/NNAA隐私审计及消融实验等多个独立证据层级,并进行功能与机制验证。

主要模型

颅内动脉瘤患者队列(1035例,多中心) GMM生成模型 Q-learning优化智能体

重点核对

数据集划分:训练:验证:测试=80:10:10,分层抽样 GMM超参数搜索空间:K∈{5,10,…,30},max_iter∈{100,200,300},n_init∈{1,3,5} 强化学习设置:学习率α=0.1,折扣因子γ=0.95,探索衰减0.995,最小探索率0.01 TSTR评估:15个独立随机种子,AUC等指标 隐私审计:DCR和NNAA指标

摘要

患者级结构化数据的共享受到隐私法规和治理的严格限制,造成“数据孤岛”,阻碍多中心研究。我们提出了CLEO(Clean-Learn-Evaluate-Optimize),一个闭环框架,将高斯混合模型生成器与基于Q学习的优化相结合,将数据合成形式化为马尔可夫决策过程。在一个多中心颅内动脉瘤数据集上的实验结果表明,CLEO的综合得分为0.9232 ± 0.0124,优于评估的代表性比较方法,包括TVAE、Gaussian Copula和CTGAN。在下游TSTR评估中,基于CLEO生成数据训练的模型实现了平均AUC为0.7376,表明合成数据保留了有用的临床决策信号。然而,Macro-F1结果也表明少数类预测仍受类别不平衡分布的影响。经验隐私审计显示,最近邻对抗准确度得分为0.4940,表明在所采用的最近邻审计设置下观察到的重识别风险较低。这些发现表明,当真实世界医疗数据无法直接聚合时,CLEO为支持跨机构研究提供了一个可控且经验上可审计的框架。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
如何在保护患者隐私的前提下,生成保持统计保真度和下游效用的医学表格数据,以支持跨机构研究?
核心机制
CLEO将数据合成形式化为马尔可夫决策过程,通过Q-learning智能体根据保真度和效用反馈自适应调整GMM超参数,实现统计保真与下游效用的权衡优化。
主要证据
在多中心颅内动脉瘤数据集上,CLEO的综合得分(0.9232)优于Gaussian Copula、TVAE、CTGAN;TSTR评估中AUC达0.7376,表明保留了临床决策信号;DCR和NNAA指标显示低重识别风险;消融实验证实RL优化模块对效用提升的贡献。
研究意义
CLEO为真实世界医疗数据无法直接聚合时提供了一种可控、经验可审计的合成数据生成框架,可能作为小样本临床研究的数据增强工具,支持跨机构研究。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

数据预处理与质量控制

处理原始数据中的噪声和长尾分布,为生成建模提供干净数据。

采用LOF算法识别局部异常值并用中位数替换,对低频类别进行合并,以缓解高维稀疏性。

2

GMM生成模型训练与合成

利用清洁数据训练GMM,生成合成表格数据。

使用GMM对清洁数据进行密度估计,通过EM算法估计参数,并生成合成数据,再进行逆变换和生理范围后处理。

3

质量评估(保真度、效用、隐私)

从统计保真度、下游效用和隐私风险三个维度评估合成数据质量。

计算KS、JS、TVD、相关性等保真度指标;采用TSTR范式评估效用;使用DCR和NNAA审计隐私。

4

闭环优化(Q-learning)

根据评估反馈自适应调整GMM超参数,优化合成数据质量。

将合成过程形式化为MDP,使用Q-learning智能体探索超参数空间,更新Q表,迭代优化。

5

模型比较与消融研究

评估CLEO相对其他生成模型的性能,以及各模块的贡献。

与TVAE、CTGAN、Gaussian Copula比较;设置无反馈、无RL等变体进行消融实验。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
高斯混合模型----
scikit-learn----
pandas----
Python 3.9----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据预处理
LOF邻居数为20,contamination='auto';类别合并阈值N<5
阅读提示:Methods: Data preprocessing and quality control
数据划分
采用分层抽样,按80:10:10划分训练、验证、测试集,训练集828例、验证集103例、测试集104例
阅读提示:Methods: Data source and research task
GMM生成
GMM参数:n_components∈{5,10,…,30},max_iter∈{100,200,300},n_init∈{1,3,5},covariance_type='full',random_state=42
阅读提示:Methods: The CLEO closed-loop synthesis framework; Table 7
Q-learning优化
状态空间4维,动作空间54,学习率α=0.1,折扣因子γ=0.95,探索衰减0.995,最小探索率0.01,30个episode
阅读提示:Methods: The CLEO closed-loop synthesis framework; Table 8
效用评估
TSTR评估使用15个独立随机种子,采用随机森林、梯度提升、XGBoost,评估AUC等指标
阅读提示:Methods: Implementation details and reproducibility; Results: Detailed downstream utility analysis