dicast:一种基于机器学习从短读长测序数据中准确检测结构变异的方法

dicast: a machine learning method for accurate structural variant detection from short-read sequencing data

作者信息Nico Alavi, M-Hossein Moeinzadeh, Jakob Hertzberg, Uirá Souto Melo, Lion Ward Al Raei, Paolo Infantino, Maryam Ghareghani, Marco Savarese, Stefan Mundlos, Martin Vingron
PMID42754892
发布时间2026-09-16
DOI10.1186/s13059-026-04280-y

实验完整度

高

含九样本多技术真值集、短读长与长读长及光学图谱多层级验证,并有机器学习功能验证和三个疾病队列临床评估

主要模型

九份患者样本的多技术测序数据(Illumina短读长、PacBio长读长、10x Genomics与TELL-Seq连锁读长、Bionano光学图谱) GIAB HG002 Tier 1 v5.0q公共基准样本 先天性肢体畸形队列(18例患者) 心房颤动与神经肌肉疾病队列

重点核对

真值集构建的确认标准:至少两种不同测序技术的方法支持、或至少两种长读长方法支持、或四个公共数据库之一支持 dicast输入为delly、manta、lumpy、gridss、cnvnator五种短读长调用器的未过滤调用集及Ebert等群体目录变异 变异类型特异性评分阈值:缺失0.45、插入0.30、重复0.40 短读长与长读长及光学图谱技术在各变异大小类别和基因组背景下的精确率与召回率评估 临床队列中候选变异经人工审校作为无偏真值,用于评估召回率与调用集缩减

摘要

结构变异是人类疾病的常见原因,但尽管短读长测序是大多数临床工作流程的基础技术,从其数据中检测结构变异仍具有挑战性。我们提出了dicast,一种机器学习方法,利用比对和基因组背景特征对来自短读长数据的结构变异调用进行评分。dicast在一个基于九份样本构建、经过大量人工审校的新型多技术真值集上训练。它优于现有的短读长调用器和共识方法,在高精度下回收了显著更多的真阳性。我们还展示了dicast在诊断中的适用性,在多个疾病队列中鉴定出所有致病变异,并且比共识方法多鉴定出20%的候选致病性缺失。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
如何从短读长测序数据中准确检测结构变异,以提高遗传病诊断中结构变异的检出与优先级排序能力。
核心机制
dicast将候选结构变异用超过100个基于比对和基因组背景的特征注释,输入在人工审校真值集上训练的XGBoost模型,输出每个变异为真阳性的概率,从而替代共识调用中单纯依赖调用器数量的启发式策略。
主要证据
在GIAB HG002 Tier 1 v5.0q基准及新构建真值集的留出样本上,dicast对缺失召回0.45、精确0.85,对插入召回45%而次优方法仅10%,对重复召回0.27、精确0.88;在肢体畸形、心房颤动和神经肌肉疾病队列中正确分类所有已知致病变异并大幅缩减候选集。
研究意义
dicast可减少临床诊断流程中需要人工审校的候选结构变异数量,保留可能被现有流程丢弃的候选变异,并可能应用于全基因组关联研究和大规模群体变异聚合。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

构建多技术结构变异真值集

建立高质量、人工审校的结构变异基准,用于评估测序技术和检测方法。

对九份患者样本使用Illumina短读长、PacBio长读长、10x Genomics和TELL-Seq连锁读长及Bionano光学图谱测序,用15种结构变异检测方法生成约3500万原始调用,经质量过滤后通过重叠图去重(断点距离≤500 bp且大小相似性≥70%),按多技术、多长读长方法或公共数据库支持标准确认变异,并用cuban可视化工具人工审校11,511个结构变异。

2

系统评估测序技术与结构变异检测方法

比较五种测序技术和15种结构变异检测方法在不同变异类型、大小和基因组背景下的表现。

在九份样本上评估各方法的精确率和召回率,采用union和共识两种调用器整合策略,并按变异大小(50–100 bp、100 bp–1 kb、1–10 kb、>10 kb)和基因组注释(CpG岛、LINE、SINE、LTR、低复杂度区域、卫星DNA、STR、VNTR等)分层分析,同时评估两种技术组合的协同效应。

3

开发并评估dicast机器学习模型

开发能区分短读长结构变异真伪的机器学习方法,并在独立基准上评估其性能。

将每个候选变异在断点两侧四个bin及变异体内部四个bin上计算覆盖率、插入片段大小、比对质量、截断读段、分裂读段、不一致读对及基因组背景等超过100个特征,输入XGBoost模型,用九份样本中八份训练、一份留出测试。在GIAB HG002 Tier 1 v5.0q基准(缺失和插入)及留出样本(重复)上评估,并与SV2和n-of-N共识策略比较,同时评估计算资源消耗。

4

在临床诊断场景中评估dicast

评估dicast在真实临床诊断流程中减少人工审校候选变异、拯救低质量调用和发现新候选变异的能力。

在18例先天性肢体畸形患者中构建三条流程:过滤短读长流程、包含低质量调用并用dicast评分的未过滤短读长流程、过滤短读长和长读长流程。结合RNA-seq和Hi-C数据用TADA方法注释功能相关变异,经人工审校获得无偏真值。另在心房颤动和神经肌肉疾病队列(含20例既往未解决NMD病例)中应用短读长流程和dicast评估已知致病变异。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
RNeasy迷你试剂盒Qiagen--
KAPA mRNA HyperPrep试剂盒--KR1352
HiSeq4000测序仪Illumina--
NEBNext Ultra II Q5预混液New England BioLabsM0544
Agencourt AMPure XP磁珠Beckman CoulterA63881
NovaSeq6000测序仪Illumina--

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
构建真值集
确认标准:至少两种不同测序技术的方法支持、至少两种长读长方法支持或四个公共数据库之一支持;断点距离≤500 bp且大小相似性≥70%;人工审校11,511个变异
阅读提示:Methods中Construction of ground truth及Manual curation of ground truth dataset小节
dicast模型训练与评估
训练样本为九份样本中八份、测试一份;输入为delly、manta、lumpy、gridss、cnvnator未过滤调用集及Ebert等群体目录;评分阈值缺失0.45、插入0.30、重复0.40;评估基准为GIAB HG002 Tier 1 v5.0q和留出样本S1
阅读提示:Methods中Development of novel SV detection method的Training和Evaluation小节及Fig. 3图注
临床诊断流程评估
肢体畸形队列18例患者;三条流程分别为过滤Illumina、未过滤Illumina加dicast、过滤PacBio和Illumina;功能注释使用RNA-seq和Hi-C;人工审校230个候选;dicast评分阈值0.4
阅读提示:Methods中Evaluation of novel SV detection method in clinical scenarios及Fig. 4图注
基因组背景分层分析
变异按大小分为50–100 bp、100 bp–1 kb、1–10 kb、>10 kb;基因组注释包括CpG岛、LINE、SINE、LTR、低复杂度区域、卫星DNA、STR、VNTR等;STR按基序长度分5类、VNTR按参考位点长度分5类
阅读提示:Methods中Evaluation of technologies小节及Additional file 1: Fig. S5
计算资源基准测试
dicast在HG002 30x Illumina WGS上48分钟墙钟时间、5.0 CPU小时、70线程、峰值内存2.8 GB;SV2单线程21小时、21.0 CPU小时、7.5 GB;硬件为双路AMD EPYC 7601、128线程、1 TB RAM、Linux 6.12、Python 3.12
阅读提示:Methods中Computational resources小节