腹腔镜胃切除术的实时多中心语义分割:AI导航系统的开发、外部验证及手术室部署

Real-time multicenter semantic segmentation for laparoscopic gastrectomy: development, external validation and operating room deployment of an AI navigation system

作者信息Ke-Cheng Zhang, Di Wu, Can-Rong Lu, Zhi Qiao, Wen-Tong Xu, Feng-Lin Liu, Jing-Yu Deng, Li Yang, Lei Guo, Tian-Yu Xie
PMID42559101
发布时间2026
DOI10.1016/j.mmr.2026.100040

实验完整度

高

该研究包含多中心视频数据训练与外部验证、实时手术室部署及临床可用性评估等多个独立证据层级,并明确包含功能验证(外科医生认知负荷评估,NASA-TLX)和机制验证(系统生成的语义分割可视化引导)。

主要模型

腹腔镜胃切除术视频帧(来自4家三级医院) YOLOv10模型 AI导航系统的实时手术室部署(15例患者)

重点核对

训练集4308帧、内部测试集1803帧、外部验证集721帧,分别含41066、17211、6685个标签 外部验证集来自3家独立医院,每个医院各1个视频 外部验证mAP@50为0.832,AP@[0.50–0.95]为0.684 平均处理时间31.8±10.7 ms/帧 术后住院时间中位数7天(IQR 6–9天)

摘要

腹腔镜胃切除术技术要求高,错误常源于情境意识有限。基于人工智能(AI)的计算机视觉可能增强术中器械和解剖结构的识别,但支持泛化、实时部署的证据仍然有限。我们进行了一项多中心研究,使用来自4家三级医院的腹腔镜胃切除术视频。数据按机构分为训练集、内部测试集和外部验证集。开发了基于You Only Look Once版本10(YOLOv10)的模型,用于识别18个类别(11种器械和7个器官),并集成到轻量级用户界面中以供床旁使用。计算了IoU为0.50时的平均精度(mAP@50)和框与掩码的AP@[0.50–0.95]、召回率和F1分数。评估了实时手术室部署的可行性。使用美国国家航空航天局任务负荷指数(NASA-TLX)评估外科医生认知负荷,并使用系统可用性量表(SUS)评估系统可用性。训练集包含4308帧(41066个标签);内部测试集包含1803帧(17211个标签);外部验证集包含721帧(6685个标签)。训练性能达到框精度0.896、召回率0.891、mAP@50 0.937和AP@[0.50–0.95] 0.846;掩码AP@[0.50–0.95]为0.809。在内部测试集上,框AP@[0.50–0.95]为0.670,掩码AP@[0.50–0.95]为0.642。外部验证达到框精度0.798、召回率0.773、F1分数0.785、mAP@50 0.832和AP@[0.50–0.95] 0.684;掩码mAP@50为0.836,AP@[0.50–0.95]为0.658。高性能类别包括吻合器、超声刀和抓钳,而大网膜和胰腺相对较低。该系统在笔记本电脑级GPU上实时运行,在腹腔镜胃切除术中提供按需叠加显示,不干扰手术流程。NASA-TLX得分为26.72±6.51,表明认知负荷较低,SUS得分为78.33±5.20,表明可用性良好。我们介绍了在多个中心开发、外部验证并实时部署用于腹腔镜胃切除术的实时AI导航系统。该模型展示了可靠的器械和器官检测与分割性能,并可用于床旁。有必要进行前瞻性试验以评估其对术中安全、效率和培训的影响。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
基于AI的计算机视觉系统能否在腹腔镜胃切除术中实时、泛化地识别器械和器官,从而提升手术导航的可行性?
核心机制
AI系统通过语义分割在高清视频帧中识别18种器械和器官类别,提供覆盖层叠加指导,辅助外科医生实时识别解剖结构和手术平面。
主要证据
模型在外部验证集上达到框mAP@50 0.832、AP@[0.50–0.95] 0.684,且通过NASA-TLX和SUS评估证实了低认知负荷和高可用性。
研究意义
为腹腔镜胃切除术提供了实时AI导航系统,并为未来提高手术安全性、效率和培训提供了基础。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

数据集构建

获取多中心、高质量的腹腔镜胃切除术视频数据以训练和验证AI模型。

从4家三级医院收集18个腹腔镜胃切除术视频,以5秒间隔提取JPEG帧,去除冗余和模糊帧后,由两名委员会认证外科医生使用Labelme对18个类别进行语义分割标注。

2

模型训练与内部评估

开发并内部评估一个基于YOLOv10的AI模型,用于实时语义分割。

在训练集上微调YOLOv10模型,监控损失和性能曲线,并在内部测试集上评估框检测和掩码分割性能。

3

外部验证

评估模型在不同医院数据上的泛化能力。

使用外部验证集测试模型的性能,并与内部测试集结果对比。

4

实时手术室部署与临床评估

将AI导航系统集成到手术室环境中,并评估其可行性和临床实用性。

将训练好的模型集成到用户界面(UI)中,连接腹腔镜系统与笔记本电脑,在15例患者的手术中实时运行,并进行认知负荷和可用性评估。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
Aesculap EinsteinVision 2.0内窥镜系统Aesculap--
Karl Storz IMAGE1 S 3D系统Karl Storz--
Labelme----
Intel Core i9Intel--
NVIDIA GeForce RTX 4070NVIDIA--
Jiuyinjiushi HD90录像单元----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据集构建
纳入标准:2022年5月至2024年12月之间进行的全腹腔镜胃切除术,视频分辨率1920×1080,25帧/秒;采样间隔为5秒;最终数据集规模(训练集4308帧,内部测试集1803帧,外部验证集721帧)
阅读提示:Methods部分中的Video dataset段落
模型训练与评估
模型架构为YOLOv10默认架构;训练轮次100 epochs,采用早停法;评估指标包括mAP@50、AP@[0.50–0.95]、precision、recall、F1 score
阅读提示:Methods部分中的Model development and evaluation metrics段落
实时手术室部署
硬件配置:Intel Core i9 CPU,64GB DDR5 RAM,NVIDIA GeForce RTX 4070 GPU;UI集成方式;目标类别选择(按需显示)
阅读提示:Methods部分中的Intraoperative deployment和Results部分中的Real-time intraoperative deployment and clinical relevance段落
认知负荷与可用性评估
使用NASA-TLX和SUS量表;NASA-TLX得分均值26.72±6.51,SUS得分均值78.33±5.20;评估对象为首席外科医生
阅读提示:Methods部分中的Cognitive load and system usability和Results部分中的Real-time intraoperative deployment and clinical relevance段落