多模态人工智能用于受累野放疗:高危儿童霍奇金淋巴瘤的临床靶区勾画

Multimodality Artificial Intelligence for Involved-Site Radiation Therapy: Clinical Target Volume Delineation in High-Risk Pediatric Hodgkin Lymphoma

作者信息Xin Tie, Sarah A Milgrom, Andrea C Lo, Anne-Marie Charpentier, Michael J LaRiviere, Danyal Maqbool, Steve Y Cho, Kara M Kelly, David Hodgson, Sharon M Castellino, Bradford S Hoppe, Tyler J Bradshaw
PMID41391612
发布时间2026-07-01
DOI10.1016/j.ijrobp.2025.12.005

实验完整度

高

包含多机构临床队列(288例)、外部验证、多种DL架构比较、消融实验、观察者间变异性评估及临床读者研究,具备功能验证与临床评估。

主要模型

儿科患者队列(AHOD 1331试验,高危HL) CT/PET图像分割模型(SwinUNETR)

重点核对

模型架构:SwinUNETR(晚期融合) 输入图像:计划CT、基线PET/CT、中期PET/CT,使用可变形配准 外部测试集:58例,来自24个机构 评估指标:DSC、HD95、ASSD 临床评估:40例,5点Likert量表

摘要

目的:霍奇金淋巴瘤(HL)受累野放疗(ISRT)的临床靶区(CTV)勾画耗时费力,因为需要分析多个时间点的正电子发射断层扫描(PET)/计算机断层扫描(CT)图像并与计划CT配准。我们的目标是开发整合多模态成像的自动CTV分割算法,以促进ISRT计划设计。方法:本研究纳入了儿童肿瘤学组AHOD 1331试验中288例高危HL患儿的计划CT、基线PET/CT(PET1)和中期PET/CT(PET2)扫描。来自24个机构的58例患者的数据被留出用于外部测试,而其余来自95个机构的230例病例用于模型开发。我们研究了3种深度学习(DL)架构(SegResNet、ResUNet和SwinUNETR),并评估了将PET1和PET2图像与计划CT结合的影响。使用Dice相似系数(DSC)和95% Hausdorff距离(HD95)评估性能。通过比较原始机构CTV与4位放射肿瘤学家对10例病例的新勾画来估计观察者间变异性。由放射肿瘤学家使用5点Likert量表对40例其他病例中表现最佳模型生成的CTV质量进行独立评估,并与原始机构CTV进行比较。结果:在外部队列中,结合计划CT、PET1和PET2图像的SwinUNETR模型实现了最高性能,DSC为0.72,HD95为34.43 mm。所有结合PET/CT图像的模型均显著优于仅使用计划CT的模型(P < .01)。观察者间变异性分析得出DSC为0.70,HD95为30.14 mm。在临床评估中,DL生成的CTV平均质量评分为3.38(满分5分),与医生手动勾画的CTV(3.13;P = .13)相当。结论:DL模型能够生成临床有用的CTV,其质量与手动勾画的CTV相当,表明其可能提高医生在ISRT计划中的效率。© 2025 Elsevier Inc.保留所有权利,包括文本和数据挖掘、AI训练及类似技术的权利。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
能否开发一种结合多模态成像的深度学习算法,自动勾画高危儿童霍奇金淋巴瘤的受累野放疗临床靶区,以辅助治疗计划?
核心机制
利用深度学习模型(SwinUNETR)融合计划CT、基线PET/CT和中期PET/CT图像,实现自动CTV分割。
主要证据
在外部测试集上,SwunUNETR晚期融合模型取得了最高性能(DSC 0.72,HD95 34.43 mm),优于仅使用计划CT的模型;临床评估显示DL生成CTV的质量与医生相当(3.38 vs 3.13,P = .13)。
研究意义
该研究表明AI辅助CTV勾画有望提高ISRT计划效率,并指出未来需在更广泛淋巴瘤患者中验证。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

数据收集与预处理

收集和标准化多机构临床数据,为模型训练和测试做准备。

从AHOD 1331试验中收集288例患者的计划CT、基线PET/CT和中期PET/CT,进行图像配准和重采样。

2

模型开发

比较不同DL架构和融合策略,开发最优的CTV分割模型。

训练SegResNet、ResUNet和SwinUNETR三种架构,使用早期和晚期融合策略,并评估输入模态的影响。

3

模型评估

评估模型在外部测试集上的性能,并与观察者间变异性和临床评估进行比较。

使用DSC、HD95、ASSD评估模型性能,并进行消融研究、IOV评估和临床评估。

4

亚组分析

分析患者特征对模型性能的影响。

按年龄、性别、治疗组、Ann Arbor分期、B症状和中期PET结果进行亚组比较。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
MIM软件----
NVIDIA A100 GPUNVIDIA--
Python 3.8.8----
PyTorch 1.13.0----
MONAI 1.3.2----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据预处理
图像重采样尺寸(1.0x1.0x2.5mm),配准方法(可变形),PET SUV转换
阅读提示:Methods - Data set 和 Image preprocessing
模型训练
训练集230例,验证集46例,补丁大小192x192x128,学习率1e-4,批次6,训练轮数300,集成3个模型
阅读提示:Methods - Implementation details
模型评估
外部测试集58例,评估指标DSC、HD95、ASSD
阅读提示:Methods - Evaluation metrics 和 Results
临床评估
40例外部测试病例,4位放射肿瘤学家,5点Likert量表
阅读提示:Methods - Clinical evaluation