急性白血病的快速表观基因组分类

Rapid epigenomic classification of acute leukemia

作者信息Til L Steinicke, Salvatore Benfatto, Maria R Capilla-Guerra, Andre B Monteleone, Jonathan H Young, Subha Shankar, Phillip D Michaels, Harrison K Tsai, Jonathan D Good, Antonia Kreso, Peter van Galen, Christoph Schliemann, Evan C Chen, Gabriel K Griffin, Volker Hovestadt
PMID40983754
期刊Nat Genet
发布时间2025-09-22
DOI10.1038/s41588-025-02321-z

实验完整度

包含参考队列构建、甲基化分类、神经网络开发与交叉验证、外部队列验证、回顾性及前瞻性纳米孔测序验证等多个独立证据层级。

主要模型

急性白血病患者样本(骨髓或外周血) 健康供者骨髓和全血样本 骨髓增生异常综合征(MDS)患者样本

重点核对

参考队列涵盖2,540例样本,来自11项已发表研究,包括儿科和成人病例 MARLIN模型输入为357,340个CpG位点,训练时随机去除99%的CpG位点 五折交叉验证使用每类50个随机样本进行训练 分类阈值设定为0.8,基于Youden指数优化 回顾性纳米孔队列包括34例样本,其中19例为首个队列,15例为第二个队列

摘要

急性白血病需要精确的分子分型和紧急治疗。然而,标准护理诊断测试耗时较长,且未涵盖急性白血病异质性的全部范围。在此,我们开发了一个使用全基因组DNA甲基化谱对急性白血病进行分类的框架。我们首先组装了一个全面的参考队列(n = 2,540个样本),并定义了38个甲基化类别。基于甲基化的分类在大多数情况下与标准病理谱系分类一致,并揭示了遗传类别之外额外的异质性。利用该参考,我们开发了一个神经网络(MARLIN;甲基化和人工智能引导的快速白血病亚型推断),用于从稀疏的DNA甲基化谱中分类急性白血病。在通过纳米孔测序分析的回顾性队列中,高置信度预测在26例中有25例与常规诊断一致。对疑似急性白血病患者的实时MARLIN分类在5例中提供了准确预测,通常在样本接收后2小时内生成。总之,我们提出了一个快速急性白血病分类的框架,补充并增强了标准护理诊断。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
如何利用DNA甲基化谱对急性白血病进行快速、精确的分子分类?
核心机制
DNA甲基化模式反映了细胞起源和肿瘤发生过程中的表观遗传状态,可用于区分急性白血病亚型,并揭示遗传学未捕获的异质性。
主要证据
通过2,540例样本的参考队列定义了38个甲基化类别,基于纳米孔测序的MARLIN分类在回顾性队列中高置信度预测与常规诊断一致(25/26例),在前瞻性队列中5/5例准确。
研究意义
该框架可补充现有诊断方法,加速急性白血病诊断流程,为临床提供及时信息,并有可能揭示新的药物反应预测标志物。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

构建参考队列

建立涵盖急性白血病全谱系的DNA甲基化参考数据集,以定义甲基化类别。

从11项已发表研究中收集2,540例样本的450k或EPIC甲基化阵列数据,共定义38个甲基化类别。

2

甲基化类别定义与标签传播

确定每个样本的甲基化类别,包括已知类别和新的类别。

采用先前研究的类别定义,对部分样本进行分裂或合并,并通过半监督聚类和标签传播为未标注样本分配类别。

3

评估分类性能

评估甲基化分类与免疫表型的一致性,并分析不一致情况。

比较甲基化分类与免疫表型,计算谱系一致性,并分析不一致病例的特征。

4

MARLIN模型开发

构建一个能在稀疏甲基化数据上进行分类的神经网络模型。

基于参考队列的beta值训练MARLIN,网络结构包括输入层(357,340个CpG位点)、两个隐藏层(256和128个节点)和输出层(42个节点),训练时输入层应用99%的dropout策略。

5

外部验证

验证MARLIN在不同甲基化平台和独立数据集上的泛化能力。

使用27k、450k阵列、WGBS和纳米孔测序数据对MARLIN进行测试,并评估其预测准确性。

6

回顾性纳米孔队列验证

在实际纳米孔测序数据上验证MARLIN的分类性能。

对34例急性白血病及MDS样本进行纳米孔测序,并使用MARLIN进行分类,与常规诊断比较。

7

前瞻性实时分类

在临床环境中验证MARLIN对疑似急性白血病患者的实时分类能力。

对5例疑似急性白血病患者样本进行实时纳米孔测序和MARLIN分类,并与常规诊断比较。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
QIAamp DNA Mini KitQiagen69506
连接测序试剂盒V14Oxford Nanopore TechnologiesSQK-LSK114
快速条码试剂盒24 V14Oxford Nanopore TechnologiesSQK-RBK114.24
快速测序试剂盒V14Oxford Nanopore TechnologiesLSK-RAD114
MinION流动池Oxford Nanopore TechnologiesFLO-MIN114 R.10.4.1
PromethION流动池Oxford Nanopore TechnologiesFLO-PRO114M R.10.4.1
流动池启动试剂盒Oxford Nanopore TechnologiesEXP-FLP004
流动池清洗试剂盒Oxford Nanopore TechnologiesEXP-WSH004
Qubit荧光计ThermoFisher ScientificQ33238
TapeStation系统Agilent TechnologiesG2992AA
GridION平台Oxford Nanopore Technologies--
MinKNOW软件Oxford Nanopore Technologiesv.24.02.16

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
参考队列构建
参考队列由11项已发表研究的2,540例高质量样本组成,样本来自儿科和成人患者,包括AML、B-ALL、T-ALL、MPAL及正常对照。数据预处理使用minfi包,并设置了样本筛选阈值。
阅读提示:Methods: Reference cohort and public data sources、Methylation array data processing
MARLIN模型训练
模型输入为357,340个CpG位点,使用训练数据中每类随机选择的50个样本,训练3,000个epoch,学习率为1e-5,并采用99%输入dropout的稀疏化模拟。
阅读提示:Methods: MARLIN development
交叉验证与性能评估
通过五折交叉验证评估性能,使用F1分数和ROC分析。分类阈值设定为0.8,基于97%稀疏度时最大化Youden指数得出。
阅读提示:Methods: MARLIN performance estimation、Threshold analysis
纳米孔测序
测序使用MinION或PromethION平台,运行时长48-72小时,并进行流动池重加载。重复样本采用多重条形码文库。
阅读提示:Methods: Library preparation、Nanopore sequencing
实时分类
实时分类需要集成MinKNOW软件、定制脚本和MARLIN模型,测序过程中每10分钟生成预测。分类达到阈值所需时间因样本而异,建议监测预测直至稳定。
阅读提示:Methods: Real-time nanopore classification