帕金森病及孤立性快速眼动睡眠行为障碍的全自动睡眠分期

Fully-automated sleep staging for Parkinson's disease and isolated REM sleep behavior disorder

作者信息Jesper Strøm, Casper Skjærbæk, Natasha Becker Bertelsen, Steffen Torpe Simonsen, Niels Okkels, David Bertram, Sinah Röttgen, Konstantin Kufer, Kaare B Mikkelsen, Marit Otto, Poul Jørgen Jennum, Per Borghammer, Michael Sommerauer, Preben Kidmose
PMID42601395
发布时间2026-08-11
DOI10.1038/s41746-026-02946-2

实验完整度

包含模型预训练、微调、多中心交叉验证、独立保留数据集验证、人类评分者间比较和置信度阈值优化REM检测等多个独立验证层级。

主要模型

U-Sleep深度学习模型 PACE和CBC研究队列(112例PD、138例iRBD、89例对照) DCSM临床保留队列(81例PD、36例iRBD、87例对照)

重点核对

微调时采用10折交叉验证,按受试者划分 保留数据集DCSM的模型评估需使用集成模型 置信度阈值0.8用于REM睡眠分类 低一致性记录(κ<0.6)需进行盲法重新评分 U-Sleep置信度是预测κ的显著因素(p<0.001)

摘要

孤立性快速眼动睡眠行为障碍(iRBD)是帕金森病(PD)的关键前驱标志物。视频多导睡眠监测(vPSG)仍是诊断的金标准,但人工睡眠分期在神经退行性疾病中尤其耗时且具有挑战性。我们改编了深度神经网络U-Sleep,用于PD和iRBD的自动睡眠分期。一个预训练模型(PUB,19,236个PSG)在多中心数据集(PACE, CBC: 112例PD,138例iRBD,89例对照)上进行微调,并在临床保留数据集(DCSM: 81例PD,36例iRBD,87例对照)上进行评估。分析了分期一致性的预测因素,并对低一致性记录进行盲法重新评分。应用基于置信度的阈值来增强REM检测。预训练模型在PACE/CBC中达到κ=0.66,微调后提高到κ=0.74(p<0.001)。在保留数据集中,平均κ从0.60增加到0.64(p<0.001)。特定站点的微调仅带来微小益处。置信度是Cohen's κ的显著预测因子(p<0.001)。低模型一致性记录也显示低的人类评分者间一致性。应用置信度阈值将REM精确度从85%提高到95.6%,同时在96%的受试者中保留了足够的REM睡眠。这个公开可用的模型达到了人类水平的一致性,能够实现可扩展、标准化的PSG分析,其中模型导出的置信度可作为进一步改进的工具。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
如何将U-Sleep深度学习模型适应并验证于帕金森病和孤立性REM睡眠行为障碍的自动睡眠分期?
核心机制
通过微调预训练模型,利用模型置信度作为预测分期一致性的指标,并应用置信度阈值优化REM睡眠检测。
主要证据
多中心数据集(PACE和CBC)上微调后平均κ从0.66提升至0.74(p<0.001),在独立保留数据集DCSM上从0.60提升至0.64(p<0.001);置信度阈值0.8时REM精确度从85%提高至95.6%。
研究意义
提供公开可用的自动睡眠分期模型,实现可扩展、标准化的PSG分析,并利用置信度指导临床审查和进一步优化。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

预训练模型复现

在大型多中心数据集上复现并评估原始U-Sleep模型。

使用公开数据集PUB(19,236个PSG,来自12个站点)重新训练U-Sleep模型,并计算验证Cohen's κ和每夜κ。

2

微调模型

在神经退行性疾病数据集上微调预训练模型,生成广义模型和站点特定模型。

在PACE和CBC数据集上分别和联合微调预训练模型,采用10折交叉验证评估。

3

独立保留数据集验证

评估广义模型在未见过的临床保留数据集上的泛化性能。

将广义模型应用于DCSM数据集,评估其睡眠分期性能,并与预训练模型和站点特定模型进行比较。

4

评分者间一致性研究

评估模型与人类评分者的一致性,并比较低一致性记录中模型与盲法评分者的表现。

选择31个PSG记录,由盲法评分者(R2)重新评分,计算模型与原始评分者(R1)、R1与R2、R2与模型之间的κ值。

5

置信度阈值优化REM检测

利用模型置信度阈值优化REM睡眠检测的精确度和召回率。

对PACE和CBC数据,应用不同置信度阈值(如0.8, 0.9)来分类REM睡眠,计算精确度、召回率以及保留至少10个REM epoch的受试者比例。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
U-Sleep----
Python----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据集划分
训练、验证和测试集按受试者划分,比例0.94、0.03、0.03;微调时10折交叉验证,每折留出10个受试者作为验证。
阅读提示:Methods: Sleep staging
模型参数
模型为2通道U-Sleep,编码器/解码器深度12,进程因子2,复杂度因子1.67,参数量约310万。
阅读提示:Methods: Sleep staging
训练细节
预训练学习率10^-4,微调学习率10^-5;批量大小64;预训练早停耐心80个epoch,微调早停耐心10个epoch。
阅读提示:Methods: Sleep staging
数据预处理
所有PSG重采样至128Hz,高通滤波0.1Hz;记录睡眠时间少于3小时或未评分epoch超过20%的被剔除。
阅读提示:Methods: Data preprocessing and Record rejection
评估指标
Cohen's κ和F1分数按每晚计算;验证时使用置换检验。
阅读提示:Methods: Sleep staging analysis
置信度阈值
阈值T=0.8或0.9用于REM分类;只有阈值超过时才将epoch分类为REM。
阅读提示:Methods: Confidence as a threshold for REM sleep classification