CLEO:用于合成医疗隐私保护表格数据的闭环框架

CLEO closed loop framework for synthesizing medical privacy preserving tabular data

作者信息Siqi Wang, Jianfeng Wang, Xiaochun Cheng, Wei Zhang, Yuan Tian, Ma Ning, Fangwei Li, Yuxin Liu
PMID42448813
发布时间2026-07-14
DOI10.1038/s41746-026-02999-3

摘要

患者级别的结构化数据共享受到隐私法规和治理的严格限制,形成了阻碍多中心研究的“数据孤岛”。我们提出了CLEO(Clean-Learn-Evaluate-Optimize)闭环框架,该框架将高斯混合模型生成器与基于Q学习的优化相结合,将数据合成形式化为马尔可夫决策过程。在多中心颅内动脉瘤数据集上的实验结果表明,CLEO的综合得分为0.9232 ± 0.0124,优于所评估的代表性对比方法,包括TVAE、Gaussian Copula和CTGAN。在下游TSTR评估中,使用CLEO生成的数据训练的模型平均AUC达到0.7376,表明合成数据保留了有用的临床决策信号。然而,Macro-F1结果也表明少数类预测仍然受到类别分布不平衡的影响。实证隐私审计显示,最近邻对抗准确度得分为0.4940,表明在采用的最近邻审计设置下观察到的再识别风险较低。这些发现表明,当真实世界的医学数据无法直接聚合时,CLEO提供了一个可控且可经验审计的框架来支持跨机构研究。

实验方法