模拟数据生成
使用模拟读段评估组装性能,避免真实读段中可能引入的偏差
从RUST基因组最大染色体的两个单倍型模拟HiFi读段,生成RUSTsim数据集
MGA: a tool for haplotype-mixed assembly of long and accurate reads
基于多种真实和模拟基因组数据集(RUST、RUST-Pst、BONOBO、HUMAN、GIRAFFE、SHEEP),通过N50、N90、相位转换率等指标进行功能验证。
小麦叶锈菌基因组(RUST) 小麦条锈菌基因组(RUST-Pst) 倭黑猩猩基因组(BONOBO) 人类HG002细胞系基因组(HUMAN) 马赛长颈鹿基因组(GIRAFFE) 绵羊父本单倍型基因组(SHEEP)
输入HiFi读段:RUST 900,485条 (L50=15 kb,53×覆盖度),RUST-Pst 705,557条 (L50=14 kb,62×覆盖度) BONOBO 1400万条HiFi读段 (L50=18 kb,45×覆盖度),HUMAN 1800万条HiFi读段 (L50=17 kb,48×覆盖度) GIRAFFE 1300万条HiFi读段 (L50=20 kb,46×覆盖度),SHEEP 1000万条HiFi读段 (L50=23 kb,36×覆盖度) 评估指标:N50、N90、相位转换率(用GraphAligner或yak评估) GIRAFFE覆盖度相关细节:GIRAFFE组装中hifiasm组装的Y染色体总长度显著小于真实单倍型,表明可能缺失部分片段
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
使用模拟读段评估组装性能,避免真实读段中可能引入的偏差
从RUST基因组最大染色体的两个单倍型模拟HiFi读段,生成RUSTsim数据集
使用真实HiFi读段生成单倍型混合组装
MGA使用LJA构建de Bruijn图,然后执行图清洗、简化、scaffolding和去冗余步骤
评估组装连续性和准确性,并与现有工具比较
使用N50、N90、相位转换率等指标评估MGA、hifiasm、Falcon、HiCanu、LJA+purge_dups的组装结果
按研究目的归类文中使用的方法,便于定位所需技术。
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据准备 | HiFi读段的来源和覆盖度:RUST(53×)、RUST-Pst(62×)、BONOBO(45×)、HUMAN(48×)、GIRAFFE(46×)、SHEEP(36×);具体读段来自NCBI或公共数据库 阅读提示:Datasets 部分 |
| 组装参数 | MGA和hifiasm的默认参数;线程数设置为50;hifiasm运行选项'--primary' 阅读提示:Assembly tools 部分 |
| 图构建 | k-mer大小(默认500)、同聚物压缩、多重de Bruijn图的非线性k-mer大小 阅读提示:De Bruijn graphs 部分 |
| 图简化参数 | minPI阈值(默认60%)、maxPathSize(默认8)、lowCov阈值、chimera阈值(默认2)、minRepairPI(默认80%)、PICognate(默认70%)、SpanCognate(默认85%) 阅读提示:Methods 部分 |
| 组装评估 | 相位转换率的计算方法(GraphAligner或yak),N50/N90计算,CRAQ和VirtualHaplome方法 阅读提示:Assembly tools 部分、Datasets 部分 |