弥合临床与家庭心电图的差距:量化并克服AI单导联心电图模型的准确性损失

Bridging the gap from clinical to home ECG: quantifying and overcoming accuracy loss in AI-enabled single-lead ECG models

作者信息Chin Lin, Wei-Ting Liu, Kai-Chieh Chen, Dung-Jang Tsai, Da-Wei Chang, Tsung-Neng Tsai, Cheng-Chung Cheng, Chih-Yuan Lin, Yuan-Hao Chen, Chien-Sung Tsai, Shih-Hua Lin, Chin-Sheng Lin
PMID42410026
发布时间2026-07
DOI10.1038/s41746-026-02919-5

实验完整度

研究包含多层级验证,包括内部测试集、外部医院验证、两种消费设备测试,并进行了设备特异性微调、学习曲线分析和分层分析,属于前瞻性实验设计。

主要模型

临床12导联心电图(Philips TC系列) Apple Watch单导联心电图 QOCA ECG102D单导联心电图

重点核对

模型训练集:246,874名患者,676,192份心电图(Neihu站点) 外部验证集:65,338名患者,219,231份心电图(Tingzhou站点) 微调训练集:Apple Watch 6618份心电图,QOCA 21,927份心电图 微调样本量:100、200、500、1000、2500份心电图 信号处理:统一重采样至500Hz,中心截取28秒(家用设备)

摘要

基于12导联记录训练的AI心电图(ECG)模型可能因设备和环境域偏移而在家用单导联设备上表现不佳。我们使用来自246,874名患者的676,192份心电图训练Lead-I模型,并在来自65,338名患者的219,231份心电图上进行外部验证。我们评估了两个方法学对照指标(性别和年龄)和七个临床表型[90天死亡率、左心室射血分数(EF)、肺动脉收缩压(PASP)、左心房内径、N末端前脑钠肽(NT-proBNP)、血红蛋白和估算肾小球滤过率]。跨医院验证显示总体性能下降很小(AUC下降<0.03)。相比之下,直接部署到来自Apple Watch(n=9835)和QOCA ECG102D(n=31,517)的消费者心电图产生了显著的准确性损失。微调后,Apple Watch和QOCA ECG102D在八个分类任务上的AUC显著提高,低EF性能较高(0.85/0.86),而PASP升高(0.73/0.68)和贫血(0.73/0.69)的性能较温和。窦性心律下的性能高于房颤。学习曲线表明,可靠的微调需要大约500-1000个标记心电图;较小的集合可能有害。我们发布了一个仅用于评估的HOME数据集,以促进跨设备泛化的可重复基准测试。模型应被解释为筛查或分诊工具,而非独立诊断测试。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
从临床12导联提取的Lead-I AI模型能否直接应用于家用单导联设备,以及在需要微调时,需要多少样本才能恢复准确性。
核心机制
跨设备域偏移导致模型性能下降,设备特异性微调通过适应制造商特定预处理、电极接触行为、采集姿势和生理波形变化来恢复性能。
主要证据
基于大规模数据集,通过跨医院验证、Apple Watch和QOCA设备测试、微调前后性能对比、学习曲线分析,证明了直接部署的性能损失和微调的有效性。
研究意义
研究结果为家庭心脏监护的AI模型部署提供了指导,强调微调的必要性,并发布了HOME基准数据集以促进可重复研究。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

基础Lead-I模型开发

训练一个在临床12导联心电图上执行的Lead-I AI模型,用于预测多种临床表型。

使用来自Neihu站点的246,874名患者的676,192份心电图,随机分为训练集(70%)和内部测试集(30%),提取Lead-I信号用于训练。

2

外部医院验证

评估基础模型在不同医院(Tingzhou站点)的泛化能力。

使用独立的65,338名患者的219,231份心电图进行外部测试。

3

家用设备直接部署测试

评估基础模型直接应用于Apple Watch和QOCA ECG102D设备数据时的性能损失。

将基础模型直接应用于Apple Watch(n=9835)和QOCA(n=31,517)数据集,计算AUC和相关系数。

4

设备特异性微调

通过使用设备特定数据微调模型,评估性能恢复程度。

对Apple Watch和QOCA ECG102D数据,使用不同样本量(100、200、500、1000、2500)进行微调,并评估分类和回归性能。

5

学习曲线分析

确定微调所需的最小样本量,以恢复性能。

通过改变微调样本量,绘制学习曲线,确定性能达到基线的样本量。

6

基准数据集构建

创建一个公开的基准数据集,用于评估跨设备泛化能力。

从Apple Watch和QOCA测试集中各采样1000个患者,每个患者保留一份心电图,构建HOME数据集。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
Philips TC系列Philips--
Apple WatchApple--
QOCA ECG102DQOCA--

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据划分
患者级划分比例70%/30%,确保跨队列患者一致性。
阅读提示:Methods - Data source and ethical statement
信号预处理
统一重采样至500Hz,Lead-I提取,滤波参数(高通0.5Hz,低通150Hz),家用设备中心截取28秒。
阅读提示:Methods - ECG signal preprocessing
标签定义
表型合并时间窗口:超声±7天,NT-proBNP±24h,Hb±12h,eGFR±30天。
阅读提示:Methods - Phenotypes used for prediction
训练参数
优化器Adam,学习率0.0001,批量大小32,权重衰减0.001,训练100轮。
阅读提示:Methods - Deep learning model training and inference
微调策略
微调样本量(100,200,500,1000,2500),平衡采样,校准方法。
阅读提示:Methods - Deep learning model training and inference