构建参考队列
建立涵盖急性白血病全谱系的DNA甲基化参考数据集,以定义甲基化类别。
从11项已发表研究中收集2,540例样本的450k或EPIC甲基化阵列数据,共定义38个甲基化类别。
Rapid epigenomic classification of acute leukemia
包含参考队列构建、甲基化分类、神经网络开发与交叉验证、外部队列验证、回顾性及前瞻性纳米孔测序验证等多个独立证据层级。
急性白血病患者样本(骨髓或外周血) 健康供者骨髓和全血样本 骨髓增生异常综合征(MDS)患者样本
参考队列涵盖2,540例样本,来自11项已发表研究,包括儿科和成人病例 MARLIN模型输入为357,340个CpG位点,训练时随机去除99%的CpG位点 五折交叉验证使用每类50个随机样本进行训练 分类阈值设定为0.8,基于Youden指数优化 回顾性纳米孔队列包括34例样本,其中19例为首个队列,15例为第二个队列
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
建立涵盖急性白血病全谱系的DNA甲基化参考数据集,以定义甲基化类别。
从11项已发表研究中收集2,540例样本的450k或EPIC甲基化阵列数据,共定义38个甲基化类别。
确定每个样本的甲基化类别,包括已知类别和新的类别。
采用先前研究的类别定义,对部分样本进行分裂或合并,并通过半监督聚类和标签传播为未标注样本分配类别。
评估甲基化分类与免疫表型的一致性,并分析不一致情况。
比较甲基化分类与免疫表型,计算谱系一致性,并分析不一致病例的特征。
构建一个能在稀疏甲基化数据上进行分类的神经网络模型。
基于参考队列的beta值训练MARLIN,网络结构包括输入层(357,340个CpG位点)、两个隐藏层(256和128个节点)和输出层(42个节点),训练时输入层应用99%的dropout策略。
验证MARLIN在不同甲基化平台和独立数据集上的泛化能力。
使用27k、450k阵列、WGBS和纳米孔测序数据对MARLIN进行测试,并评估其预测准确性。
在实际纳米孔测序数据上验证MARLIN的分类性能。
对34例急性白血病及MDS样本进行纳米孔测序,并使用MARLIN进行分类,与常规诊断比较。
在临床环境中验证MARLIN对疑似急性白血病患者的实时分类能力。
对5例疑似急性白血病患者样本进行实时纳米孔测序和MARLIN分类,并与常规诊断比较。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| DNA提取 | QIAamp DNA Mini Kit | Qiagen | 69506 |
| 文库制备 | 连接测序试剂盒V14 | Oxford Nanopore Technologies | SQK-LSK114 |
| 快速条码试剂盒24 V14 | Oxford Nanopore Technologies | SQK-RBK114.24 | |
| 快速测序试剂盒V14 | Oxford Nanopore Technologies | LSK-RAD114 | |
| 纳米孔测序 | MinION流动池 | Oxford Nanopore Technologies | FLO-MIN114 R.10.4.1 |
| PromethION流动池 | Oxford Nanopore Technologies | FLO-PRO114M R.10.4.1 | |
| 流动池启动试剂盒 | Oxford Nanopore Technologies | EXP-FLP004 | |
| 流动池清洗试剂盒 | Oxford Nanopore Technologies | EXP-WSH004 | |
| DNA定量 | Qubit荧光计 | ThermoFisher Scientific | Q33238 |
| DNA片段分析 | TapeStation系统 | Agilent Technologies | G2992AA |
| 实时测序 | GridION平台 | Oxford Nanopore Technologies | -- |
| MinKNOW软件 | Oxford Nanopore Technologies | v.24.02.16 |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 参考队列构建 | 参考队列由11项已发表研究的2,540例高质量样本组成,样本来自儿科和成人患者,包括AML、B-ALL、T-ALL、MPAL及正常对照。数据预处理使用minfi包,并设置了样本筛选阈值。 阅读提示:Methods: Reference cohort and public data sources、Methylation array data processing |
| MARLIN模型训练 | 模型输入为357,340个CpG位点,使用训练数据中每类随机选择的50个样本,训练3,000个epoch,学习率为1e-5,并采用99%输入dropout的稀疏化模拟。 阅读提示:Methods: MARLIN development |
| 交叉验证与性能评估 | 通过五折交叉验证评估性能,使用F1分数和ROC分析。分类阈值设定为0.8,基于97%稀疏度时最大化Youden指数得出。 阅读提示:Methods: MARLIN performance estimation、Threshold analysis |
| 纳米孔测序 | 测序使用MinION或PromethION平台,运行时长48-72小时,并进行流动池重加载。重复样本采用多重条形码文库。 阅读提示:Methods: Library preparation、Nanopore sequencing |
| 实时分类 | 实时分类需要集成MinKNOW软件、定制脚本和MARLIN模型,测序过程中每10分钟生成预测。分类达到阈值所需时间因样本而异,建议监测预测直至稳定。 阅读提示:Methods: Real-time nanopore classification |