可解释人工智能决策支持工具在NSCLC中的临床可用性及多模态模型评估

Clinical usability of an explainable AI decision support tool and evaluation of multimodal models in NSCLC

作者信息Arsela Prelaj, Vanja Miskovic, Matteo Sacco, Alberto Ferrarin, Cristina Maria Licciardello, Leonardo Provenzano, Margherita Favali, Ludovica Lerma, Aleksandra Zec, Andrea Spagnoletti, Monica Ganzinelli, Daniele Lorenzini, Beshoy Guirges, Luca Invernizzi, Cecilia Silvestri, Laura Mazzeo, Marco Meazza Prina, Giulia Corrao, Margherita Ruggirello, Andra Diana Dumitrascu, Rosa Maria Di Mauro, Dario Monzani, Gabriella Pravettoni, Michele Zanitti, Davide Macocchi, Moreno Bruno Marino, Chiara Cavalli, Rebecca Romanò, Claudia Giani, Samuel G Armato 3rd, Alessandra Esposito, Christine M Bestvina, Maria Spector, Bogot R Naama, Reham Basheer, Adi Lahiani Hafzadi, Laila Roisman, Iris Watermann, Marlen Szewczyk, Till Olchers, Heinz Richter, Constantin Blanke-Roeser, Costanza Siniscalchi, Anna Di Lello, Teresa Arangoa, Valentina Bartolomeo, Nikolaos Spathas, Evangelos Sarris, Elena Fountzilas, Aina Arbusà Roca, Rocio Caro-Consuegra, Patricia Iranzo, Melissa Fernández-Pinto, Jose Rodríguez-Morató, Luca Agnelli, Mario Occhipinti, Marta Brambilla, Teresa Beni
PMID42733093
期刊Nat Med
发布时间2026-09
DOI10.1038/s41591-026-04488-2

实验完整度

高

多中心真实世界队列,含体外AI建模、影像组学、病理组学及临床可用性试验,并有内部测试与外部验证。

主要模型

NSCLC患者队列(C23:C2+C3,n=2,075) 外部验证队列(UOC,n=251) 非IO队列(EGFR突变和化疗队列) 临床可用性评估队列(n=100)

重点核对

数据集划分:TRAIN(85%,n=1,550)、TEST(15%,n=274)、EXVAL(n=251) 主要终点:OS24、OS6、DCR分类及OS生存分析 模型比较:MLEF vs DLIF vs 单一生物标志物(PD-L1、ECOG PS、NLR、LDH、LIPI) 公平性分析:以中心、性别、种族为保护属性 临床可用性研究:20名医生(10名专家,10名非专家)评估100例患者

摘要

尽管经过十年发展,非小细胞肺癌(NSCLC)的免疫治疗(IO)选择仍主要依赖亚组分析和不够完善的程序性死亡配体1(PD-L1)及临床评分。据我们所知,I3LUNG(NCT05537922)是目前最大的国际性、真实世界、多模态、基于人工智能(AI)的研究,入组了2,396例患者。我们将真实世界临床和血液(CB)数据、计算机断层扫描(CT)图像、数字病理(DP)和基因组学整合到机器学习早期融合(MLEF)和深度学习中间融合(DLIF)模型中。机器学习和深度学习仅CB模型在各结局中表现一致,测试集中的曲线下面积(AUC)高达0.77。外部验证中的性能下降可能反映了人群差异(AUC范围:0.55–0.72)。AI模型在独立测试集中显著优于PD-L1、东部肿瘤协作组体能状态(ECOG PS)、中性粒细胞与淋巴细胞比值(NLR)、乳酸脱氢酶(LDH)和肺免疫预后指数(LIPI)评分。临床可用性研究显示,肺部专家和非专家医生使用基于可解释AI(XAI)的ML仅CB工具后,其预测能力得到改善。尽管多模态整合与MLEF(CB+CT+DP)与更高性能相关,但其增量获益仍不确定,未在测试集和外部验证中转化。I3LUNG项目是一个开创性框架,展示了AI工具的临床实用性。目前正在超过2,000例患者中对决策支持系统(包括CB和多模态)进行前瞻性验证。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
在晚期NSCLC中,基于真实世界临床和血液数据的AI模型能否优于传统生物标志物预测免疫治疗结局,并且多模态整合能否进一步提升性能?
核心机制
AI模型通过整合常规临床和血液特征(以及影像、病理和基因组数据)捕捉免疫治疗反应的预后信号,其预测能力部分通过ECOG PS、转移部位、NLR和LDH等特征实现。
主要证据
ML和DL仅CB模型在测试集中AUC高达0.77,显著优于PD-L1、ECOG PS、NLR、LDH和LIPI评分;多模态MLEF在交叉验证中显示增量获益(AUC高达0.88),但在独立测试和外部验证中未一致复现;临床可用性研究显示XAI工具使医生DCR预测敏感性从0.72提升至0.87。
研究意义
I3LUNG项目为NSCLC免疫治疗决策支持提供了大规模真实世界证据,表明仅血液AI模型可超越传统生物标志物,且可解释AI能改善医生决策,为未来前瞻性验证和临床实施奠定基础。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

多中心真实世界队列构建与特征提取

建立大规模NSCLC免疫治疗患者队列,提取临床、血液、影像、病理和基因组多模态特征。

从6个国际中心回顾性收集2,396例接受IO或IO/CHT治疗的晚期NSCLC患者数据,包括CB、CT、DP和基因组数据,并进行质量控制和特征选择。

2

仅血液AI模型开发与内部验证

评估仅使用常规临床和血液数据的ML和DL模型在预测IO结局中的性能。

使用MLEF和DLIF方法构建分类(OS24、OS6、DCR)和生存(OS)模型,在TRAIN集中采用留一中心交叉验证,并在TEST和EXVAL集中评估。

3

多模态整合模型构建与评估

测试在血液数据基础上加入CT影像、数字病理和基因组数据是否能提升预测性能。

使用MLEF和DLIF框架整合CB、CT(PYRAD和FMRAD)、DP和基因组数据,比较单模态、双模态和多模态模型的性能。

4

模型与单一生物标志物比较

验证AI模型是否优于现有临床生物标志物(PD-L1、ECOG PS、NLR、LDH、LIPI)的预测能力。

在TEST集中比较ML/DL CB-only模型与单一生物标志物的AUC,并使用Kaplan-Meier和Cox模型比较风险分层能力。

5

公平性审计与可解释性分析

评估模型在不同亚组中的公平性,并解释模型预测的关键特征。

以中心、性别、种族为保护属性进行公平性分析(TPR、FPR、C-index),并使用SHAP进行全局和局部可解释性分析。

6

临床可用性研究

评估可解释AI工具是否能改善医生对NSCLC患者IO结局的预测准确性。

20名医生(10名专家,10名非专家)分两阶段评估100例患者(80例来自TEST,20例来自EXVAL),阶段1仅使用临床数据和影像,阶段2额外使用AI模型输出和SHAP解释。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
PyRadiomics----
Prov-GigaPath----
TITAN----
3D Slicer----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
患者队列与数据收集
纳入标准:IIIC–IVB期NSCLC,接受IO或IO/CHT治疗;数据收集时间范围:2012年9月至2023年10月;6个中心来源;样本量:2,396例。
阅读提示:Methods部分'Patient enrollment'小节及Extended Data Fig. 1a。
CB特征选择与模型输入
最终9个CB特征:sex, ECOG PS, smoking status, PD-L1, metastatic sites (bone, liver, brain), NLR, LDH;缺失值处理:IterativeImputer。
阅读提示:Methods部分'Development of the AI tools'小节及Supplementary Information 1, Table 2。
数据集划分与交叉验证
TRAIN集:n=1,550(85%),5折LOCO交叉验证;TEST集:n=274(15%);EXVAL集:n=251(来自UOC)。
阅读提示:Methods部分'Development of the AI tools'小节及Results 'Overview of the study design'。
临床终点定义
OS24:24个月生存状态;OS6:6个月生存状态;DCR:根据RECIST v1.1分类;OS:从IO开始至死亡或末次随访。
阅读提示:Methods部分'Clinical endpoints'小节。
临床可用性研究设计
100例患者(80例TEST,20例EXVAL);20名医生(10名专家,10名非专家);每名医生评估10例患者;两阶段评估;终点:DCR和OS。
阅读提示:Methods部分'Clinical usability with ML CB-only model'小节及Fig. 5a。