数据协调与变量筛选
在两个队列中确定共同的临床变量,并筛选用于聚类分析的变量。
对两研究的变量字典和数据收集方法进行比对,统一单位,通过相关性分析和缺失率筛选变量,最终确定56个聚类变量,并进行多重插补。
Endotypes of Vascular Health Predict Transplantation-Free Survival in Pulmonary Hypertension
该研究包含独立发现队列和多中心验证队列的无监督聚类分析,并通过代谢组学检测和生存分析进行功能验证,属于两个独立证据层级。
CC-PH注册登记研究队列 PVDOMICS队列
K-means聚类分析中聚类数K=3由贝叶斯信息准则确定 CC-PH队列与PVDOMICS队列在临床特征上存在差异,需验证模型的可迁移性 精氨酸通路代谢物和D-二聚体的测量方法(高效液相色谱和非靶向代谢组学)需核对 统计分析中使用Cox比例风险模型和Kaplan-Meier生存曲线
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
在两个队列中确定共同的临床变量,并筛选用于聚类分析的变量。
对两研究的变量字典和数据收集方法进行比对,统一单位,通过相关性分析和缺失率筛选变量,最终确定56个聚类变量,并进行多重插补。
在CC-PH队列中识别新的PH临床聚类。
使用K-means算法对CC-PH队列的56个聚类变量进行聚类,聚类数由贝叶斯信息准则确定,并通过非负矩阵分解合并5个插补数据集的结果。
开发预测模型,将CC-PH队列的聚类标签应用于PVDOMICS队列,验证聚类的稳健性。
使用梯度提升模型(XGBoost)基于聚类变量进行训练,然后应用于PVDOMICS队列,通过多数投票确定每个参与者的最终聚类。
评估新识别的PH聚类在无移植生存期上的差异。
使用Kaplan-Meier曲线估计无移植生存概率,并使用对数秩检验和Cox比例风险模型比较生存差异。
探索新聚类与内皮健康生物标志物(精氨酸-NO代谢物和D-二聚体)的关联。
在PVDOMICS队列中测量精氨酸通路代谢物(精氨酸、鸟氨酸、瓜氨酸、ADMA、硝酸盐)和D-二聚体,计算整体精氨酸生物利用度,并比较不同聚类间的差异,同时评估这些生物标志物对聚类和预后的预测能力。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 代谢物测量 | 高效液相色谱 | -- | -- |
| 非靶向代谢组学 | Metabolon公司 | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据协调 | 变量筛选标准(相关性阈值、缺失率)、插补方法 阅读提示:Methods部分:'Data Harmonization'和'Clustering Variables and Missing Data' |
| 聚类分析 | 聚类变量列表、聚类数K=3、K-means算法参数 阅读提示:Methods部分:'Clustering Analysis' |
| 模型预测 | 梯度提升模型参数、特征重要性排序 阅读提示:Methods部分:'PH Cluster Prediction' |
| 生存分析 | 终点定义、随访时间、统计方法(对数秩检验、Cox模型) 阅读提示:Methods部分:'Statistical Analysis'及Figure legends |
| 生物标志物测量 | 精氨酸代谢物测量方法、D-二聚体检测方法、样本处理 阅读提示:Methods部分:'Pulmonary Vascular Diseases Phenomics'及表4 |