构建多技术结构变异真值集
建立高质量、人工审校的结构变异基准,用于评估测序技术和检测方法。
对九份患者样本使用Illumina短读长、PacBio长读长、10x Genomics和TELL-Seq连锁读长及Bionano光学图谱测序,用15种结构变异检测方法生成约3500万原始调用,经质量过滤后通过重叠图去重(断点距离≤500 bp且大小相似性≥70%),按多技术、多长读长方法或公共数据库支持标准确认变异,并用cuban可视化工具人工审校11,511个结构变异。
dicast: a machine learning method for accurate structural variant detection from short-read sequencing data
含九样本多技术真值集、短读长与长读长及光学图谱多层级验证,并有机器学习功能验证和三个疾病队列临床评估
九份患者样本的多技术测序数据(Illumina短读长、PacBio长读长、10x Genomics与TELL-Seq连锁读长、Bionano光学图谱) GIAB HG002 Tier 1 v5.0q公共基准样本 先天性肢体畸形队列(18例患者) 心房颤动与神经肌肉疾病队列
真值集构建的确认标准:至少两种不同测序技术的方法支持、或至少两种长读长方法支持、或四个公共数据库之一支持 dicast输入为delly、manta、lumpy、gridss、cnvnator五种短读长调用器的未过滤调用集及Ebert等群体目录变异 变异类型特异性评分阈值:缺失0.45、插入0.30、重复0.40 短读长与长读长及光学图谱技术在各变异大小类别和基因组背景下的精确率与召回率评估 临床队列中候选变异经人工审校作为无偏真值,用于评估召回率与调用集缩减
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
建立高质量、人工审校的结构变异基准,用于评估测序技术和检测方法。
对九份患者样本使用Illumina短读长、PacBio长读长、10x Genomics和TELL-Seq连锁读长及Bionano光学图谱测序,用15种结构变异检测方法生成约3500万原始调用,经质量过滤后通过重叠图去重(断点距离≤500 bp且大小相似性≥70%),按多技术、多长读长方法或公共数据库支持标准确认变异,并用cuban可视化工具人工审校11,511个结构变异。
比较五种测序技术和15种结构变异检测方法在不同变异类型、大小和基因组背景下的表现。
在九份样本上评估各方法的精确率和召回率,采用union和共识两种调用器整合策略,并按变异大小(50–100 bp、100 bp–1 kb、1–10 kb、>10 kb)和基因组注释(CpG岛、LINE、SINE、LTR、低复杂度区域、卫星DNA、STR、VNTR等)分层分析,同时评估两种技术组合的协同效应。
开发能区分短读长结构变异真伪的机器学习方法,并在独立基准上评估其性能。
将每个候选变异在断点两侧四个bin及变异体内部四个bin上计算覆盖率、插入片段大小、比对质量、截断读段、分裂读段、不一致读对及基因组背景等超过100个特征,输入XGBoost模型,用九份样本中八份训练、一份留出测试。在GIAB HG002 Tier 1 v5.0q基准(缺失和插入)及留出样本(重复)上评估,并与SV2和n-of-N共识策略比较,同时评估计算资源消耗。
评估dicast在真实临床诊断流程中减少人工审校候选变异、拯救低质量调用和发现新候选变异的能力。
在18例先天性肢体畸形患者中构建三条流程:过滤短读长流程、包含低质量调用并用dicast评分的未过滤短读长流程、过滤短读长和长读长流程。结合RNA-seq和Hi-C数据用TADA方法注释功能相关变异,经人工审校获得无偏真值。另在心房颤动和神经肌肉疾病队列(含20例既往未解决NMD病例)中应用短读长流程和dicast评估已知致病变异。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| RNA-seq | RNeasy迷你试剂盒 | Qiagen | -- |
| KAPA mRNA HyperPrep试剂盒 | -- | KR1352 | |
| HiSeq4000测序仪 | Illumina | -- | |
| Hi-C | NEBNext Ultra II Q5预混液 | New England BioLabs | M0544 |
| Agencourt AMPure XP磁珠 | Beckman Coulter | A63881 | |
| NovaSeq6000测序仪 | Illumina | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 构建真值集 | 确认标准:至少两种不同测序技术的方法支持、至少两种长读长方法支持或四个公共数据库之一支持;断点距离≤500 bp且大小相似性≥70%;人工审校11,511个变异 阅读提示:Methods中Construction of ground truth及Manual curation of ground truth dataset小节 |
| dicast模型训练与评估 | 训练样本为九份样本中八份、测试一份;输入为delly、manta、lumpy、gridss、cnvnator未过滤调用集及Ebert等群体目录;评分阈值缺失0.45、插入0.30、重复0.40;评估基准为GIAB HG002 Tier 1 v5.0q和留出样本S1 阅读提示:Methods中Development of novel SV detection method的Training和Evaluation小节及Fig. 3图注 |
| 临床诊断流程评估 | 肢体畸形队列18例患者;三条流程分别为过滤Illumina、未过滤Illumina加dicast、过滤PacBio和Illumina;功能注释使用RNA-seq和Hi-C;人工审校230个候选;dicast评分阈值0.4 阅读提示:Methods中Evaluation of novel SV detection method in clinical scenarios及Fig. 4图注 |
| 基因组背景分层分析 | 变异按大小分为50–100 bp、100 bp–1 kb、1–10 kb、>10 kb;基因组注释包括CpG岛、LINE、SINE、LTR、低复杂度区域、卫星DNA、STR、VNTR等;STR按基序长度分5类、VNTR按参考位点长度分5类 阅读提示:Methods中Evaluation of technologies小节及Additional file 1: Fig. S5 |
| 计算资源基准测试 | dicast在HG002 30x Illumina WGS上48分钟墙钟时间、5.0 CPU小时、70线程、峰值内存2.8 GB;SV2单线程21小时、21.0 CPU小时、7.5 GB;硬件为双路AMD EPYC 7601、128线程、1 TB RAM、Linux 6.12、Python 3.12 阅读提示:Methods中Computational resources小节 |