数据收集与整理
整合来自多个队列的临床、治疗和ctDNA数据,构建全球数据集。
从6个队列(NCC-1、NCC-2、LUCID、TRACERx、Stanford、Moding et al.)收集493例I–III期NSCLC患者的781份血液样本,包括临床特征、治疗方式、生存结局和ctDNA检测结果。
PRIME: an interpretable artificial intelligence model based on liquid biopsy improves prediction of progression risk in non-small cell lung cancer
包含多队列数据整合、机器学习模型训练与验证、外部独立验证,以及利用TCGA WES/WGS和RNA-seq进行突变预后和机制验证。
I–III期NSCLC患者队列(n=493) TCGA WES/WGS组织测序队列(n=430) TCGA RNA-seq队列(n=1041肿瘤样本和108健康对照) 血液样本(n=781)
临床分期、治疗前ctDNA状态、治疗后MRD状态、KEAP1/STK11/CDKN2A突变状态、治疗方式等7个关键预测因素 训练集和验证集的划分(n=345 vs. n=148) MRD阳性判定标准(4条共识标准) ctDNA检测平台(固定panel vs. 个性化panel) ML模型训练算法(NN、决策树等6种)
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
整合来自多个队列的临床、治疗和ctDNA数据,构建全球数据集。
从6个队列(NCC-1、NCC-2、LUCID、TRACERx、Stanford、Moding et al.)收集493例I–III期NSCLC患者的781份血液样本,包括临床特征、治疗方式、生存结局和ctDNA检测结果。
识别与疾病进展显著相关的临床和基因组特征。
通过逻辑回归分析24个潜在特征,筛选出与进展风险显著相关的因素,并检查多重共线性。
构建并比较多种机器学习模型,选择最优模型预测疾病进展风险。
采用6种机器学习算法(NN、决策树、RUSBoost、朴素贝叶斯、SVM、KNN)在训练集上训练PRIME模型,并在独立验证集上评估性能,使用AUC等指标进行比较。
量化各特征对模型预测的贡献,增强模型可解释性。
使用SHAP分析对NN-PRIME模型的预测进行解释,确定特征重要性排名和贡献方向。
评估模型在不同临床场景和检测平台下的泛化能力。
在验证集、不同分期、不同治疗方式、不同ctDNA检测平台(固定panel和个性化panel)中评估NN-PRIME的风险分层能力,并进行敏感性和亚组分析。
在独立肿瘤组织测序数据中验证血液检测到的KEAP1/STK11/CDKN2A突变的预后效应。
使用TCGA中430例II–III期NSCLC患者的WES/WGS数据,比较KEAP1、STK11和CDKN2A突变型与野生型患者的总体生存期。
研究KEAP1/STK11/CDKN2A突变导致不良预后的潜在免疫机制。
利用TCGA RNA-seq数据(1041例肿瘤和108例正常)进行差异表达、功能富集和免疫浸润分析,结合GSEA探索相关通路。
按研究目的归类文中使用的方法,便于定位所需技术。
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据收集与患者纳入 | 队列组成(NCC-1、NCC-2、LUCID、TRACERx、Stanford、Moding et al.)、纳入标准(早期或局限性NSCLC、接受根治性手术或放化疗、纵向ctDNA数据)、各队列患者数量及基线特征 阅读提示:Methods部分“Description of the data and participants” |
| ctDNA检测与MRD判定 | ctDNA检测平台(固定panel或个性化panel)、MRD阳性判定标准(4条共识标准)、MRD检测时间点(治疗后2周至4个月内) 阅读提示:Methods部分“Standardized ctDNA-MRD detection across cohorts” |
| 特征筛选 | 逻辑回归分析中的24个特征、P值<0.05的筛选标准、VIF计算 阅读提示:Methods部分“Feature selection for the ML models”和Results部分“Comprehensive features identified for model construction” |
| 机器学习模型训练与验证 | 训练集(NCC-1、NCC-2、Stanford、LUCID)和验证集(TRACERx、Moding et al.)的划分、6种ML算法(NN、决策树等)、模型评估指标(AUC、F1分数等) 阅读提示:Methods部分“ML model training and validation” |
| 基因组突变验证 | TCGA WES/WGS队列(n=430)的患者纳入标准(II–III期NSCLC、接受局部治疗)、突变类型(KEAP1/STK11/CDKN2A)、生存分析(OS) 阅读提示:Methods部分“Genomic mutation analyses”和Results部分“KEAP1, STK11, and CDKN2A mutations suggest poor prognosis” |
| 转录组机制探索 | RNA-seq样本(1041例肿瘤和108例正常)、差异表达分析、GO/KEGG富集、免疫浸润分析、GSEA 阅读提示:Methods部分“Genomic mutation analyses”和Results部分“Transcriptomic profiling and immune landscape of KEAP1, STK11, and CDKN2A” |