PRIME:基于液体活检的可解释人工智能模型改善了非小细胞肺癌进展风险的预测

PRIME: an interpretable artificial intelligence model based on liquid biopsy improves prediction of progression risk in non-small cell lung cancer

作者信息Yu Wang, Yong-Bo Xiang, Xiao-Wei Chen, Tao Zhang, Jian-Yang Wang, Wen-Yang Liu, Lei Deng, Lu-Hua Wang, Shu-Geng Gao, Nan Bi
PMID41491583
发布时间2026-01
DOI10.1186/s40779-025-00679-z

实验完整度

高

包含多队列数据整合、机器学习模型训练与验证、外部独立验证,以及利用TCGA WES/WGS和RNA-seq进行突变预后和机制验证。

主要模型

I–III期NSCLC患者队列(n=493) TCGA WES/WGS组织测序队列(n=430) TCGA RNA-seq队列(n=1041肿瘤样本和108健康对照) 血液样本(n=781)

重点核对

临床分期、治疗前ctDNA状态、治疗后MRD状态、KEAP1/STK11/CDKN2A突变状态、治疗方式等7个关键预测因素 训练集和验证集的划分(n=345 vs. n=148) MRD阳性判定标准(4条共识标准) ctDNA检测平台(固定panel vs. 个性化panel) ML模型训练算法(NN、决策树等6种)

摘要

背景:尽管循环肿瘤DNA(ctDNA)微小残留病灶(MRD)具有预测价值,但早期或局限性非小细胞肺癌(NSCLC)患者在根治性治疗后准确预测失败风险以指导个体化治疗仍具挑战性。本研究旨在利用全球数据资源开发并验证一个可解释的人工智能辅助模型。方法:从6个队列中收集了接受手术或根治性放化疗的I–III期NSCLC患者的液体活检数据、血液基因组改变、临床病理特征和生存结局。PRIME(通过ctDNA-MRD、突变和临床治疗特征的可解释机器学习预测进展风险)在4个队列中采用6种机器学习算法进行训练,并在2个独立队列中进行验证。模型性能通过曲线下面积(AUC)评估,并通过SHapley Additive exPlanations(SHAP)进行解释。来自癌症基因组图谱的430例II–III期NSCLC患者的肿瘤组织全外显子组测序(WES)或全基因组测序(WGS)数据以及1149名受试者的RNA测序(RNA-seq)数据被用于验证外周血中检测到的突变的预后效应并研究潜在机制。结果:分析了来自493例患者的781份血液样本组成的全球数据集。临床分期、治疗前ctDNA、治疗后MRD、血液中Kelch样ECH相关蛋白1(KEAP1)、丝氨酸/苏氨酸激酶11(STK11)和周期蛋白依赖性激酶抑制剂2A(CDKN2A)突变以及治疗方式与疾病进展风险显著相关,并因此纳入模型训练。WES/WGS和RNA-seq证实了KEAP1、STK11和CDKN2A突变的不良预后效应,其特征是抑制性肿瘤微环境和减弱的体液免疫。神经网络(NN)模型在训练集(AUC = 0.85,95% CI 0.81–0.89)和验证集(AUC = 0.82,95% CI 0.74–0.89)中均显示出对治疗失败风险的最佳预测能力。SHAP分析表明,MRD(+0.306)、治疗方式(+0.128)和治疗前ctDNA(+0.043)位列前三大贡献因素。NN-PRIME优于单一的液体活检生物标志物和临床治疗特征,并在不同临床场景中表现出一致的稳健性。NN-PRIME识别的高风险患者预后较差,但术后辅助治疗获益显著。结论:作为一个整合了易于获取且关键的临床基因组预测因素的可解释模型,PRIME实现了增强的性能,能够进行早期结果预测、精细的风险分层和个体化临床决策。补充信息:在线版本包含补充材料,网址为10.1186/s40779-025-00679-z。关键词:非小细胞肺癌,人工智能,液体活检,机器学习,循环肿瘤DNA,微小残留病灶。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
如何利用可解释的人工智能模型整合液体活检和临床基因组特征,以早期预测早期或局限性NSCLC患者根治性治疗后的进展风险?
核心机制
KEAP1、STK11和CDKN2A突变通过抑制肿瘤微环境中的体液免疫(减少嗜酸性粒细胞、肥大细胞、Th17细胞等浸润,下调巨噬细胞分化、肥大细胞活化和B细胞介导的免疫相关通路)而赋予不良预后。
主要证据
利用6个队列的781份血液样本训练并验证了NN-PRIME模型(训练集AUC=0.85,验证集AUC=0.82),并通过TCGA WES/WGS(n=430)验证了KEAP1/STK11/CDKN2A突变的不良预后,RNA-seq(n=1041)揭示免疫抑制机制。
研究意义
PRIME模型可实现早期结果预测、风险分层和个体化临床决策,为接受辅助治疗的高风险患者提供指导,并计划在前瞻性临床试验中进一步验证。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

数据收集与整理

整合来自多个队列的临床、治疗和ctDNA数据,构建全球数据集。

从6个队列(NCC-1、NCC-2、LUCID、TRACERx、Stanford、Moding et al.)收集493例I–III期NSCLC患者的781份血液样本,包括临床特征、治疗方式、生存结局和ctDNA检测结果。

2

特征筛选

识别与疾病进展显著相关的临床和基因组特征。

通过逻辑回归分析24个潜在特征,筛选出与进展风险显著相关的因素,并检查多重共线性。

3

机器学习模型训练与验证

构建并比较多种机器学习模型,选择最优模型预测疾病进展风险。

采用6种机器学习算法(NN、决策树、RUSBoost、朴素贝叶斯、SVM、KNN)在训练集上训练PRIME模型,并在独立验证集上评估性能,使用AUC等指标进行比较。

4

模型解释

量化各特征对模型预测的贡献,增强模型可解释性。

使用SHAP分析对NN-PRIME模型的预测进行解释,确定特征重要性排名和贡献方向。

5

外部验证和稳健性分析

评估模型在不同临床场景和检测平台下的泛化能力。

在验证集、不同分期、不同治疗方式、不同ctDNA检测平台(固定panel和个性化panel)中评估NN-PRIME的风险分层能力,并进行敏感性和亚组分析。

6

基因组突变预后验证

在独立肿瘤组织测序数据中验证血液检测到的KEAP1/STK11/CDKN2A突变的预后效应。

使用TCGA中430例II–III期NSCLC患者的WES/WGS数据,比较KEAP1、STK11和CDKN2A突变型与野生型患者的总体生存期。

7

转录组机制探索

研究KEAP1/STK11/CDKN2A突变导致不良预后的潜在免疫机制。

利用TCGA RNA-seq数据(1041例肿瘤和108例正常)进行差异表达、功能富集和免疫浸润分析,结合GSEA探索相关通路。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
Python--v3.12
MATLAB--R2022a
R软件--v4.4.1

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据收集与患者纳入
队列组成(NCC-1、NCC-2、LUCID、TRACERx、Stanford、Moding et al.)、纳入标准(早期或局限性NSCLC、接受根治性手术或放化疗、纵向ctDNA数据)、各队列患者数量及基线特征
阅读提示:Methods部分“Description of the data and participants”
ctDNA检测与MRD判定
ctDNA检测平台(固定panel或个性化panel)、MRD阳性判定标准(4条共识标准)、MRD检测时间点(治疗后2周至4个月内)
阅读提示:Methods部分“Standardized ctDNA-MRD detection across cohorts”
特征筛选
逻辑回归分析中的24个特征、P值<0.05的筛选标准、VIF计算
阅读提示:Methods部分“Feature selection for the ML models”和Results部分“Comprehensive features identified for model construction”
机器学习模型训练与验证
训练集(NCC-1、NCC-2、Stanford、LUCID)和验证集(TRACERx、Moding et al.)的划分、6种ML算法(NN、决策树等)、模型评估指标(AUC、F1分数等)
阅读提示:Methods部分“ML model training and validation”
基因组突变验证
TCGA WES/WGS队列(n=430)的患者纳入标准(II–III期NSCLC、接受局部治疗)、突变类型(KEAP1/STK11/CDKN2A)、生存分析(OS)
阅读提示:Methods部分“Genomic mutation analyses”和Results部分“KEAP1, STK11, and CDKN2A mutations suggest poor prognosis”
转录组机制探索
RNA-seq样本(1041例肿瘤和108例正常)、差异表达分析、GO/KEGG富集、免疫浸润分析、GSEA
阅读提示:Methods部分“Genomic mutation analyses”和Results部分“Transcriptomic profiling and immune landscape of KEAP1, STK11, and CDKN2A”