CLEO:用于合成医疗隐私保护表格数据的闭环框架
CLEO closed loop framework for synthesizing medical privacy preserving tabular data
患者级别的结构化数据共享受到隐私法规和治理的严格限制,形成了阻碍多中心研究的“数据孤岛”。我们提出了CLEO(Clean-Learn-Evaluate-Optimize)闭环框架,该框架将高斯混合模型生成器与基于Q学习的优化相结合,将数据合成形式化为马尔可夫决策过程。在多中心颅内动脉瘤数据集上的实验结果表明,CLEO的综合得分为0.9232 ± 0.0124,优于所评估的代表性对比方法,包括TVAE、Gaussian Copula和CTGAN。在下游TSTR评估中,使用CLEO生成的数据训练的模型平均AUC达到0.7376,表明合成数据保留了有用的临床决策信号。然而,Macro-F1结果也表明少数类预测仍然受到类别分布不平衡的影响。实证隐私审计显示,最近邻对抗准确度得分为0.4940,表明在采用的最近邻审计设置下观察到的再识别风险较低。这些发现表明,当真实世界的医学数据无法直接聚合时,CLEO提供了一个可控且可经验审计的框架来支持跨机构研究。