数据集构建与预处理
收集真实的胎儿超声扫描视频和音频,并转换为可用于模型训练的文本和图像数据。
使用7名超声技师(6女1男)在三级医院诊所进行常规产科超声扫描,记录了525对视频-音频数据,时间跨度为2019年1月21日至2023年2月9日。视频以全高清分辨率(1920×1080像素)和30帧每秒录制,音频通过麦克风记录。使用WhisperX将音频转录为文本,共得到79,885个句子,每句平均长度为9.24个单词。按时间顺序将数据划分为训练集(456对)、验证集(14对)和测试集(55对)。
A visually grounded language model for fetal ultrasound understanding
包含数据集构建、模型预训练、解剖检测、VQA任务及消融实验,但缺乏体外或动物等生物实验验证。
胎儿超声视频-音频数据集(PULSE研究) 早孕期胎儿超声图像数据集 中孕期胎儿超声图像数据集 公开母胎超声数据集
视频帧下采样频率:每秒5帧 句子转录工具:WhisperX 解剖检测评估数据集:早孕期、中孕期、公开母胎超声数据集 细粒度对齐中的上下文帧数l=2 训练/验证/测试划分:456/14/55
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
收集真实的胎儿超声扫描视频和音频,并转换为可用于模型训练的文本和图像数据。
使用7名超声技师(6女1男)在三级医院诊所进行常规产科超声扫描,记录了525对视频-音频数据,时间跨度为2019年1月21日至2023年2月9日。视频以全高清分辨率(1920×1080像素)和30帧每秒录制,音频通过麦克风记录。使用WhisperX将音频转录为文本,共得到79,885个句子,每句平均长度为9.24个单词。按时间顺序将数据划分为训练集(456对)、验证集(14对)和测试集(55对)。
对齐视频和文本特征空间,使模型能够从超声技师视角理解超声视频。
使用对比学习损失进行粗粒度视频-文本对齐,将配对视频和文本特征拉近,非配对特征推远。在细粒度图像-句子对齐中,根据句子的时间戳将句子特征与对应帧特征对齐。针对异构语言问题,提出解剖感知对齐,使用超声词汇表提取关键词并简化句子;针对异步内容问题,提出上下文标签校正和自适应标签校正,以修正对齐标签。总损失函数为L = Lcoarse + Lfine + Lfine'。
评估模型在无标注数据上对胎儿超声图像中解剖结构的分类能力。
使用三个数据集进行评估:早孕期数据集(5类)、中孕期数据集(8类)和公开母胎超声数据集(6类)。采用知识增强解剖检测流程,利用解剖知识图谱生成类文本嵌入。比较了三种知识整合方法:句子拼接、子类嵌入平均和余弦相似度平均。与CLIP、PubMedCLIP、BiomedCLIP及全监督模型(SimCLR、SonoNet、PULSENet)进行比较,并进行了人类表现对比和消融实验。
使Sonomate能够回答关于胎儿超声图像和视频的问题,实现机器与用户的交互。
构建图像级和视频级VQA数据集。图像级VQA包含5种问题类型,训练数据172,801个样本;视频级VQA包含5种问题类型,训练数据196,858个样本。使用多模态解码器(四层Transformer)处理视觉和问题特征,并结合外部知识增强回答。对解码器进行训练,优化目标为负对数似然损失和掩码语言建模损失。评估性能指标包括准确率、F1分数、BLEU-1/2和最小编辑距离。
确保模型在部署时安全,避免对分布外问题给出不合理回答。
开发了两种方法:分布外问题检测和问题改写生成。分布外问题检测网络对问题文本进行分类,识别是否为生物测量、孕期或解剖相关;问题改写生成使用余弦相似度将输入问题改写为模型可理解的形式。使用ChatGPT 3.5扩展问题模板从5个到200个。测试了包括改写、拼写错误等边缘情况,评估了检测精度和改写对准确率的影响。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 数据采集 | GE医疗Voluson E8 | GE Healthcare | -- |
| GE医疗Voluson E10 | GE Healthcare | -- | |
| C2-9-D | -- | -- | |
| C1-6-D | -- | -- | |
| C1-5-D | -- | -- | |
| RAB6-D | -- | -- | |
| RC6M | -- | -- | |
| DVI2PCIe | epiphany video | -- | |
| PCC160 | Crown HARMAN | -- | |
| 音频转录 | WhisperX | -- | -- |
| 模型训练 | NVIDIA Quadro RTX 8000 | NVIDIA | -- |
| Intel(R) Xeon(R) Gold 5215 CPU | Intel | -- | |
| 问题改写 | humarin/chatgpt_paraphraser_on_T5_base | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据采集 | 超声设备型号(GE Voluson E8/E10)、探头型号、视频分辨率(1920×1080)、帧率(30fps)、音频录制设备(PCC160) 阅读提示:Methods部分'Description of dataset'和'Video–text pairs collection' |
| 数据预处理 | 帧下采样频率(5帧每秒)、音频转录工具(WhisperX)、句子筛选条件(少于3个单词去除) 阅读提示:Methods部分'Data preprocessing' |
| 跨模态对齐预训练 | 视觉编码器(ViT-B/16)和文本编码器(BERT)初始化权重(BiomedCLIP)、句子最大长度(36个单词)、视频窗口长度(120秒)、批次大小(24)、学习率(2e-6)、上下文标签校正的l=2 阅读提示:Methods部分'Fine-grained image–sentence alignment'和'Implementation details' |
| 解剖检测 | 评估数据集(早孕期、中孕期、公开母胎超声数据集)、知识图谱(Extended Data Table 2)、知识整合方法(句子拼接等)、性能指标(召回率、精度、F1) 阅读提示:Methods部分'Knowledge-enhanced anatomy detection'和'Validation datasets for anatomy detection' |
| 视觉问答 | VQA数据集构建方法、解码器结构(四层Transformer)、批次大小(图像级160,视频级64)、学习率、外部知识整合方式 阅读提示:Methods部分'Knowledge-based VQA'和'Dataset for image-level question answering' |