多视图深度学习提高超声心动图对主要心脏状况的检测能力

Multiview deep learning improves detection of major cardiac conditions from echocardiography

作者信息Joshua P Barrios, Minhaj U Ansari, Jeffrey E Olgin, Sean Abreau, Jacques Delfrate, Elodie L Langlais, Robert Avram, Geoffrey H Tison
PMID41844861
发布时间2026-03
DOI10.1038/s44161-026-00786-7

实验完整度

包含多中心回顾性队列(UCSF训练与内部验证、MHI外部验证)、多任务(三个主要任务和七个亚任务)、模型对比(单视图、多视图、平均融合)及解释性分析(Grad-CAM),证据层级完整。

主要模型

UCSF成人经胸超声心动图队列 MHI成人经胸超声心动图外部验证队列

重点核对

三个输入视图:A4c、A2c、PLAX(非多普勒)用于心室异常和舒张功能障碍;A4c、A5c、PLAX(彩色多普勒)用于瓣膜反流 标签定义:心室异常为LV/RV大小或功能任一异常;舒张功能障碍为ASE分级1-4级;显著瓣膜反流为二尖瓣、三尖瓣或主动脉瓣中度或以上反流 数据划分:按患者70/15/15分为训练/开发/测试集 DNN训练:X3D-M骨干,输入64帧,随机裁剪、颜色抖动、旋转等数据增强 统计比较:AUC差异使用DeLong检验,多重比较采用Bonferroni校正

摘要

医学成像通常捕获三维解剖结构的多个二维视图,但大多数人工智能(AI)模型分析的是二维数据。在此,我们展示了使用单一AI模型整合多个成像视图可以提高诊断性能。我们开发了一种深度神经网络(DNN)架构,可同时组合来自多个视频视图的信息。利用加州大学旧金山分校和蒙特利尔心脏研究所的超声心动图数据,我们将我们的多视图DNN方法应用于三个主要示范任务:检测任何左或右心室异常、舒张功能障碍和显著瓣膜反流。在各种任务中,与在任何单一视图上训练的DNN相比,我们的多视图DNN将受试者工作特征曲线下面积(AUC)提高了0.06-0.09。这表明,能够同时组合来自多个成像视图信息的AI模型可以更好地捕捉某些任务的复杂解剖和生理,凸显了多视图范式在医学成像AI中的价值。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
整合多个二维超声心动图视图的AI模型能否比单视图模型更准确地检测心脏异常?
核心机制
多视图DNN通过中融合策略,在中间层跨视图卷积整合时空信息,从而学习视图间互补特征,提高诊断性能。
主要证据
在UCSF测试集和MHI外部验证集上,多视图DNN在三个任务上的AUC均显著高于最佳单视图DNN,且高于三个单视图DNN输出的平均值(除了MHI瓣膜反流亚组未达到显著)。
研究意义
多视图范式为医学成像AI模型提供了新的训练理念,可提高对复杂解剖和生理的捕捉能力,有望用于超声心动图的自动分诊。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

数据准备与预处理

建立可用于训练和验证的超声心动图视频数据集,并进行标准化处理。

从UCSF和MHI收集成人经胸超声心动图研究,提取像素数据,生成掩膜并裁剪至224x224像素,排除经食管、心内和负荷超声。

2

视图和彩色多普勒分类器训练

自动识别超声心动图视频的视图类型和是否存在彩色多普勒信号,以选择特定任务的输入视图。

使用X3D-M视频DNN训练21类视图分类器和彩色多普勒检测器,并应用于所有UCSF超声数据以筛选视频。

3

多视图DNN架构设计

构建能够同时整合多个输入视图信息的DNN架构。

基于X3D-M骨干网络,修改为多视图输入,通过5个卷积块提取每个视图的嵌入,然后沿新视图维度拼接,再通过额外的卷积块进行跨视图卷积,实现中融合。

4

多视图和单视图DNN训练与内部验证

训练多视图和单视图DNN,并在UCSF测试集上比较其性能。

为每个任务训练多视图DNN和对应的三个单视图DNN,以及三个单视图输出的平均值,使用AUC等指标评估。

5

外部验证

在独立机构MHI的数据集上评估多视图DNN的泛化性能。

使用相同的预处理和视图分类器处理MHI数据,运行训练好的多视图DNN,并计算性能指标。

6

亚任务和分层分析

评估多视图DNN在复合终点各个组成部分以及不同年龄、性别、射血分数亚组中的性能。

训练针对单个异常(如LV大小、LVEF、RV功能等)的单视图和多视图DNN,并在整个测试集和亚组中评估。

7

可解释性分析

可视化DNN用于预测的输入视频区域,以理解其决策依据。

使用Grad-CAM和guided Grad-CAM技术生成热图,展示对预测贡献最大的像素区域。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
PyTorch----
NVIDIA Quadro RTX 8000NVIDIA--
pandas----
numpy----
scikit-learn----
statsmodels----
MLstatkit----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据预处理
掩膜生成、裁剪至224x224像素、排除非移动像素;视图分类器训练数据(6,549份超声,1,437名患者);多普勒分类器训练数据
阅读提示:Methods: Cohort selection and data sources; Extended Data Fig. 1
模型训练
训练/开发/测试划分比例70/15/15;超参数范围(学习率1e-6至5e-2,衰减因子0.3/0.5/0.7,耐心3/5/7/10);优化器SGD(动量0.9,权重衰减0.0001);训练轮数50;数据增强参数
阅读提示:Methods: DNN training
多视图DNN架构
输入三个视图的视频,每个视频64帧;嵌入拼接方式;跨视图卷积块设计
阅读提示:Methods: DNN architectures; Fig. 2
性能评估
AUC计算、最佳阈值选择(最大化F1分数);CIs通过bootstrap 1000次获得;DeLong检验;Bonferroni校正
阅读提示:Methods: Statistical analysis; Table 2, Table 3, Table 4