一项强调使用视觉和惯性传感器进行烦躁运动识别挑战的机器学习研究

A machine learning study highlighting the challenges of fidgety movement recognition using vision and inertial sensors

作者信息Falco Lentzsch, Frédéric Li, Friederike Pagel, Margot Lau, Andrea Kock, Hanna Marie Röhling, Anne Stein, Maciej Baranowski, Marco Maass, Hannes Hölzl, Sebastian Glende, Sebastian Mansow-Model, Ute Thyen, Marcin Grzegorzek
PMID41490995
期刊Sci Rep
发布时间2026-01-05
DOI10.1038/s41598-025-28523-3

实验完整度

研究包含95名婴儿的RGB-D和IMU数据采集、OpenPose身体追踪、三种机器学习方法(手工特征、多分支CNN、对抗解缠)的模型训练和评估,以及t-SNE和ANE指标的解缠评估,但缺乏外部验证和机制验证。

主要模型

95名婴儿队列(49名男性,46名女性,平均年龄15周) RGB-D视频数据 IMU惯性传感器数据

重点核对

受试者独立评估(subject-independent)设置,采用5折交叉验证,确保同一受试者数据不跨折 数据标注由三位临床专家独立标注后进行联合标注,使用多数投票确定标签 IMU传感器放置在婴儿上臂和大腿,采样频率200Hz,重采样至100Hz 视频和IMU数据的同步通过OpenPose关键点时间序列相关性对齐 分类性能指标包括Accuracy、F1-score、Sensitivity、Specificity

摘要

过去的医学研究表明,婴儿的运动与早期神经发育密切相关。烦躁运动(Fidgety Movements)是健康婴儿在20周龄前出现的反射样运动,尤为重要,因为过去的研究强调其缺失与脑瘫等神经系统疾病的未来发展密切相关。为了提供及时的干预,提出了全身运动评估(General Movement Assessment)作为由经过专门培训的临床人员进行的筛查医疗程序,以识别烦躁运动。由于其耗费时间和资源,文献中已提出多项使用机器学习技术自动化全身运动评估的方案。然而,迄今为止没有一项能够成为最先进的方法。为了研究这个问题,我们使用深度学习方法学习可解缠的特征表示,用于识别烦躁运动,数据来自95名婴儿(平均年龄:周)的RGB-D视频和惯性测量单元数据。我们的结果表明,虽然可以学习独立于受试者信息的运动特征,但获得能够一致泛化到训练中未见过受试者的特征表示仍然具有挑战性。更具体地,我们观察到基于视觉和基于传感器的模态在识别烦躁运动时都有特定的挑战需要解决。我们讨论这些问题,并为未来有兴趣研究这一问题的研究人员提供建议。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
使用RGB-D视频和IMU传感器数据,通过机器学习方法识别烦躁运动(FMs)是否可行,以及特征表示能否泛化到未见过的受试者。
核心机制
特征解缠(feature disentanglement)技术,通过对抗训练和变分自编码器分离运动特征和受试者身份特征,以提高跨受试者的泛化能力。
主要证据
在95名婴儿数据集上评估了三种方法:手工特征+随机森林、多分支CNN、对抗解缠(CSAD),使用5折交叉验证,结果显示所有方法在受试者独立测试中性能均较低,最佳AF1为57.24%(MBCNN使用IMU和Kinect),且CSAD虽实现了特征解缠但分类性能未提升。
研究意义
研究强调自动化全身运动评估(GMA)面临的挑战,为未来研究提供了实用建议,包括选择更精确的身体追踪算法、标准化IMU放置和使用额外模态等。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

数据采集

获取婴儿的RGB-D视频和IMU数据,用于后续分析和模型训练。

在德国吕贝克大学附属医院设置受控环境,使用iPhone 12 Pro和微软Kinect Azure摄像头记录RGB-D视频,使用四台MoveSense HR+ IMU记录运动数据,共采集103名婴儿数据,8名因技术问题被排除,最终95名婴儿数据有效。

2

数据标注

为视频数据提供烦躁运动的真实标注,以训练监督模型。

三位经过培训的临床专家使用基于网络的视频标注工具独立标注每小时段中的烦躁运动起止时间和身体区域,并在第二阶段由至少两位专家联合标注,以修正和合并标注。

3

数据预处理

同步多模态数据并分割成可用于训练的数据帧。

使用婴儿适配版OpenPose提取视频关键点,通过相关性和视觉检查对齐同步视频流,然后将IMU数据重采样至100Hz,使用DepthPose提取3D关键点,最后将数据分割成1秒的非重叠窗口。

4

模型训练

训练分类模型,以区分烦躁运动的存在与否。

训练了三种模型:手工特征+随机森林(HCF)、多分支CNN(MBCNN)和对抗解缠(CSAD),使用不同模态(Kinect、IMU、两者结合)进行训练,并采用受试者独立的5折交叉验证。

5

性能评估

评估模型在未见受试者上的泛化能力。

在测试集上计算分类指标,并与训练集指标对比,观察泛化差距;同时使用t-SNE和ANE指标评估特征解缠质量。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
iPhone 12 ProApple--
微软Kinect AzureMicrosoft--
MoveSense HR+Movesense--
KAASA视频标注工具KAASA solution GmbH--
OpenPose----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据采集
受试者样本量(95名婴儿)、年龄范围(平均15周,最大15周)、性别分布(49男46女)、高风险婴儿数(6名)
阅读提示:Materials and Methods,Dataset,Data acquisition
数据采集
IMU型号(MoveSense HR+)、采样频率(200Hz)、放置位置(上臂和大腿)、固定方式(医用纱布)、方向标准化方法(箭头指向头部)
阅读提示:Materials and Methods,Dataset,Data acquisition
数据采集
视频录制设备(iPhone 12 Pro、Kinect Azure)、分辨率(1080p)、帧率(60fps、30fps)、摄像头与婴儿距离(约90cm)
阅读提示:Materials and Methods,Dataset,Data acquisition
数据预处理
OpenPose版本(婴儿适配版)、关键点数量(33个)、时序对齐方法(最大相关)
阅读提示:Materials and Methods,Data preprocessing
模型训练
5折交叉验证划分方法、风险婴儿分配、模型超参数(MBCNN学习率、epoch、batch size等)
阅读提示:Experiments and results,MBCNN results