MGA:一种用于长且准确读长的单倍型混合装配工具

MGA: a tool for haplotype-mixed assembly of long and accurate reads

作者信息Zhenmiao Zhang, Marcus W Fedarko, Anton Bankevich, Pavel A Pevzner
PMID42310681
发布时间2026-06-17
DOI10.1186/s13059-026-04128-5

实验完整度

基于多种真实和模拟基因组数据集(RUST、RUST-Pst、BONOBO、HUMAN、GIRAFFE、SHEEP),通过N50、N90、相位转换率等指标进行功能验证。

主要模型

小麦叶锈菌基因组(RUST) 小麦条锈菌基因组(RUST-Pst) 倭黑猩猩基因组(BONOBO) 人类HG002细胞系基因组(HUMAN) 马赛长颈鹿基因组(GIRAFFE) 绵羊父本单倍型基因组(SHEEP)

重点核对

输入HiFi读段:RUST 900,485条 (L50=15 kb,53×覆盖度),RUST-Pst 705,557条 (L50=14 kb,62×覆盖度) BONOBO 1400万条HiFi读段 (L50=18 kb,45×覆盖度),HUMAN 1800万条HiFi读段 (L50=17 kb,48×覆盖度) GIRAFFE 1300万条HiFi读段 (L50=20 kb,46×覆盖度),SHEEP 1000万条HiFi读段 (L50=23 kb,36×覆盖度) 评估指标:N50、N90、相位转换率(用GraphAligner或yak评估) GIRAFFE覆盖度相关细节:GIRAFFE组装中hifiasm组装的Y染色体总长度显著小于真实单倍型,表明可能缺失部分片段

摘要

最近的大规模基因组测序项目已经生成了近乎完整的二倍体组装,该组装重建了两个单倍型。生成这样的组装仍然是一项艰巨的任务,通常需要大型团队、广泛的手动整理以及多种测序技术的整合。然而,对于许多物种和应用而言,近乎完整的单倍型混合组装——代表两个单倍型的嵌合体——为下游分析提供了大部分相同的益处。此类组装可以使用仅HiFi读段自动且以较低成本生成。在这里,我们介绍了Mosaic Genome Assembler (MGA),一种仅从HiFi读段生成近乎完整的单倍型混合组装的工具。我们表明,MGA在性能上显著优于现有的单倍型混合组装器。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
如何仅使用HiFi读段生成高质量的、近乎完整的单倍型混合(共有序列)基因组组装?
核心机制
MGA通过扩展气泡折叠并引入detouring、dewhirling、decoupling、broken tip repairing和短边收缩等图简化操作,并在多重de Bruijn图上进行,从而生成连续的共有序列。
主要证据
在模拟数据RUSTsim上,MGA实现了1.2%的相位转换率,优于hifiasm的2.1%;在真实数据集上,MGA在大多数基因组中实现了更高的N50和更低的相位转换率,例如人类N50达143.4 Mb(hifiasm为95.4 Mb)。
研究意义
MGA为构建单倍型混合组装提供了一种经济有效的替代方案,尤其适用于大规模测序项目,他们可能优先考虑参考基因组而非完全解析两个单倍型。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

模拟数据生成

使用模拟读段评估组装性能,避免真实读段中可能引入的偏差

从RUST基因组最大染色体的两个单倍型模拟HiFi读段,生成RUSTsim数据集

2

真实数据组装

使用真实HiFi读段生成单倍型混合组装

MGA使用LJA构建de Bruijn图,然后执行图清洗、简化、scaffolding和去冗余步骤

3

组装质量评估

评估组装连续性和准确性,并与现有工具比较

使用N50、N90、相位转换率等指标评估MGA、hifiasm、Falcon、HiCanu、LJA+purge_dups的组装结果

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
minimap2--version 2.21-r1071
LJA----
hifiasm----
Falcon----
HiCanu----
Flye----
purge_dups----
GraphAligner--v1.0.19
CRAQ----
QUAST-LG----
yak----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据准备
HiFi读段的来源和覆盖度:RUST(53×)、RUST-Pst(62×)、BONOBO(45×)、HUMAN(48×)、GIRAFFE(46×)、SHEEP(36×);具体读段来自NCBI或公共数据库
阅读提示:Datasets 部分
组装参数
MGA和hifiasm的默认参数;线程数设置为50;hifiasm运行选项'--primary'
阅读提示:Assembly tools 部分
图构建
k-mer大小(默认500)、同聚物压缩、多重de Bruijn图的非线性k-mer大小
阅读提示:De Bruijn graphs 部分
图简化参数
minPI阈值(默认60%)、maxPathSize(默认8)、lowCov阈值、chimera阈值(默认2)、minRepairPI(默认80%)、PICognate(默认70%)、SpanCognate(默认85%)
阅读提示:Methods 部分
组装评估
相位转换率的计算方法(GraphAligner或yak),N50/N90计算,CRAQ和VirtualHaplome方法
阅读提示:Assembly tools 部分、Datasets 部分