一种用于胎儿超声理解的视觉接地语言模型

A visually grounded language model for fetal ultrasound understanding

作者信息Xiaoqing Guo, Mohammad Alsharid, He Zhao, Yipei Wang, Jayne Lander, Aris T Papageorghiou, J Alison Noble
PMID41540148
发布时间2026-08
DOI10.1038/s41551-025-01578-3

实验完整度

包含数据集构建、模型预训练、解剖检测、VQA任务及消融实验,但缺乏体外或动物等生物实验验证。

主要模型

胎儿超声视频-音频数据集(PULSE研究) 早孕期胎儿超声图像数据集 中孕期胎儿超声图像数据集 公开母胎超声数据集

重点核对

视频帧下采样频率:每秒5帧 句子转录工具:WhisperX 解剖检测评估数据集:早孕期、中孕期、公开母胎超声数据集 细粒度对齐中的上下文帧数l=2 训练/验证/测试划分:456/14/55

摘要

手持式胎儿超声检查需要大量的临床技能。在此,我们提出了Sonomate(超声技师之伴),一个在胎儿超声检查期间为用户提供协助的AI助手。Sonomate基于对齐视频特征和源自转录音频的文本特征,以促进超声机器与用户之间的实时交互。我们的方法结合了粗粒度视频-文本对齐与细粒度图像-句子对齐,构建了一个能够理解胎儿超声视频的稳健的视觉接地语言模型。为了解决真实世界视频-音频对中异构语言和异步内容带来的挑战,我们在细粒度对齐中设计了解剖感知对齐和上下文标签校正。Sonomate在胎儿超声图像中的解剖检测中表现出色,无需在手动标注数据上重新训练。此外,Sonomate在胎儿超声图像和视频的视觉问答中显示出有前景的性能。在部署期间建立了防护措施以确保Sonomate的安全性。这一进展为AI辅助技术用于支持超声培训和提高诊断能力铺平了道路。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
如何构建一个能够理解胎儿超声视频并实时交互的视觉接地语言模型,以辅助超声技师?
核心机制
通过粗粒度视频-文本对齐和细粒度图像-句子对齐,结合解剖感知对齐和上下文标签校正,实现跨模态特征空间对齐。
主要证据
在解剖检测任务中,Sonomate在孕中期数据集上达到77.2%的召回率,优于CLIP、PubMedCLIP和BiomedCLIP;在图像级和视频级VQA任务中,Sonomate优于基线模型。
研究意义
Sonomate是首个用于胎儿超声视频理解的医学影像语言模型,为超声培训和支持诊断能力提供了AI辅助技术。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

数据集构建与预处理

收集真实的胎儿超声扫描视频和音频,并转换为可用于模型训练的文本和图像数据。

使用7名超声技师(6女1男)在三级医院诊所进行常规产科超声扫描,记录了525对视频-音频数据,时间跨度为2019年1月21日至2023年2月9日。视频以全高清分辨率(1920×1080像素)和30帧每秒录制,音频通过麦克风记录。使用WhisperX将音频转录为文本,共得到79,885个句子,每句平均长度为9.24个单词。按时间顺序将数据划分为训练集(456对)、验证集(14对)和测试集(55对)。

2

跨模态对齐预训练

对齐视频和文本特征空间,使模型能够从超声技师视角理解超声视频。

使用对比学习损失进行粗粒度视频-文本对齐,将配对视频和文本特征拉近,非配对特征推远。在细粒度图像-句子对齐中,根据句子的时间戳将句子特征与对应帧特征对齐。针对异构语言问题,提出解剖感知对齐,使用超声词汇表提取关键词并简化句子;针对异步内容问题,提出上下文标签校正和自适应标签校正,以修正对齐标签。总损失函数为L = Lcoarse + Lfine + Lfine'。

3

解剖检测评估

评估模型在无标注数据上对胎儿超声图像中解剖结构的分类能力。

使用三个数据集进行评估:早孕期数据集(5类)、中孕期数据集(8类)和公开母胎超声数据集(6类)。采用知识增强解剖检测流程,利用解剖知识图谱生成类文本嵌入。比较了三种知识整合方法:句子拼接、子类嵌入平均和余弦相似度平均。与CLIP、PubMedCLIP、BiomedCLIP及全监督模型(SimCLR、SonoNet、PULSENet)进行比较,并进行了人类表现对比和消融实验。

4

视觉问答(VQA)任务

使Sonomate能够回答关于胎儿超声图像和视频的问题,实现机器与用户的交互。

构建图像级和视频级VQA数据集。图像级VQA包含5种问题类型,训练数据172,801个样本;视频级VQA包含5种问题类型,训练数据196,858个样本。使用多模态解码器(四层Transformer)处理视觉和问题特征,并结合外部知识增强回答。对解码器进行训练,优化目标为负对数似然损失和掩码语言建模损失。评估性能指标包括准确率、F1分数、BLEU-1/2和最小编辑距离。

5

防护措施评估

确保模型在部署时安全,避免对分布外问题给出不合理回答。

开发了两种方法:分布外问题检测和问题改写生成。分布外问题检测网络对问题文本进行分类,识别是否为生物测量、孕期或解剖相关;问题改写生成使用余弦相似度将输入问题改写为模型可理解的形式。使用ChatGPT 3.5扩展问题模板从5个到200个。测试了包括改写、拼写错误等边缘情况,评估了检测精度和改写对准确率的影响。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
GE医疗Voluson E8GE Healthcare--
GE医疗Voluson E10GE Healthcare--
C2-9-D----
C1-6-D----
C1-5-D----
RAB6-D----
RC6M----
DVI2PCIeepiphany video--
PCC160Crown HARMAN--
WhisperX----
NVIDIA Quadro RTX 8000NVIDIA--
Intel(R) Xeon(R) Gold 5215 CPUIntel--
humarin/chatgpt_paraphraser_on_T5_base----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据采集
超声设备型号(GE Voluson E8/E10)、探头型号、视频分辨率(1920×1080)、帧率(30fps)、音频录制设备(PCC160)
阅读提示:Methods部分'Description of dataset'和'Video–text pairs collection'
数据预处理
帧下采样频率(5帧每秒)、音频转录工具(WhisperX)、句子筛选条件(少于3个单词去除)
阅读提示:Methods部分'Data preprocessing'
跨模态对齐预训练
视觉编码器(ViT-B/16)和文本编码器(BERT)初始化权重(BiomedCLIP)、句子最大长度(36个单词)、视频窗口长度(120秒)、批次大小(24)、学习率(2e-6)、上下文标签校正的l=2
阅读提示:Methods部分'Fine-grained image–sentence alignment'和'Implementation details'
解剖检测
评估数据集(早孕期、中孕期、公开母胎超声数据集)、知识图谱(Extended Data Table 2)、知识整合方法(句子拼接等)、性能指标(召回率、精度、F1)
阅读提示:Methods部分'Knowledge-enhanced anatomy detection'和'Validation datasets for anatomy detection'
视觉问答
VQA数据集构建方法、解码器结构(四层Transformer)、批次大小(图像级160,视频级64)、学习率、外部知识整合方式
阅读提示:Methods部分'Knowledge-based VQA'和'Dataset for image-level question answering'