泛基因组图构建与位点边界优化
为目标位点构建局部泛基因组图,并优化位点边界以最大化保留单倍型覆盖
使用minimap2将单倍型组装比对至参考染色体,通过impg进行坐标liftover和过滤,bedtools提取序列,PGGB构建局部泛基因组图,ODGI进行图操作,FLAGGER标注的低质量区域被排除
COSIGT: population-scalable genotyping of complex loci from low-coverage sequencing data using pangenome graphs
包含方法学算法开发、多覆盖度基准测试、aDNA模拟、HLA分型及Moli-sani队列验证,含功能与机制验证
1000 Genomes Project短读长样本(326 CMRGs及265 SVs) HPRCy1及HGSVCv3单倍型解析组装(泛基因组图构建) 模拟古DNA(aDNA)样本(1X/2X,0%或10%污染) Moli-sani队列1,085例短读长全基因组样本(HLA分型)
泛基因组图构建:HPRCy1(38个二倍体组装)与HGSVCv3(65个二倍体组装)单倍型解析组装,补充CHM13和GRCh38参考 低覆盖度基准:CMRGs在30X、5X、2X、1X覆盖度下与Locityper比较QVpred,1X/2X下COSIGT错误率显著降低 aDNA模拟:48个CMRGs,1X和2X覆盖度,0%或10%污染,平均片段长度70 bp,读长100 bp,单链脱氨损伤 Leave-all-out基准:真实单倍型排除于泛基因组图,CMRGs和SVs在30X下QVfrac评估 HLA分型验证:1,085例Moli-sani样本,与HLA*IMP:02及T1K比较,单倍型水平准确率89.5%
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
为目标位点构建局部泛基因组图,并优化位点边界以最大化保留单倍型覆盖
使用minimap2将单倍型组装比对至参考染色体,通过impg进行坐标liftover和过滤,bedtools提取序列,PGGB构建局部泛基因组图,ODGI进行图操作,FLAGGER标注的低质量区域被排除
降低参考偏差,召回未能比对到参考基因组但可能比对到替代单倍型的读段,并将所有读段投影到泛基因组图
使用Meryl构建k-mer数据库(k=31),kfilt通过分层索引(Bloom filter、哈希表、BK树)招募含至少一个精确k-mer匹配的未比对读段,samtools提取目标区域读段,bwa-mem2比对到单倍型序列,gfainject将比对投影到泛基因组图
计算样本和单倍型的节点覆盖度向量,通过余弦相似度识别最可能的二倍体基因型
gafpack将GAF比对转换为每节点长度归一化、多比对加权的覆盖度向量;odgi paths -H生成单倍型拷贝数向量;枚举所有二倍体单倍型对,求和得到候选基因型向量;计算样本向量与候选基因型向量的余弦相似度,选择相似度最高的单倍型对作为预测基因型
在多个覆盖度、数据集和模拟条件下评估COSIGT相对于Locityper的基因分型准确性
在1000G短读长样本中,对326个CMRGs和265个SVs进行leave-zero-out和leave-all-out基准测试;模拟aDNA(1X/2X,0%/10%污染);在Moli-sani队列中进行HLA分型并与HLA*IMP:02和T1K比较;使用QVpred、QVfrac和错误率评估性能
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 泛基因组图构建 | PGGB | -- | -- |
| 泛基因组图操作 | ODGI | -- | -- |
| 单倍型比对 | minimap2 | -- | -- |
| 坐标liftover和过滤 | impg | -- | -- |
| 序列提取 | bedtools | -- | -- |
| 未比对读段招募 | kfilt | -- | -- |
| k-mer数据库构建 | Meryl | -- | -- |
| 短读段比对 | bwa-mem2 | -- | -- |
| 古DNA比对 | bwa aln | -- | -- |
| 图投影 | gfainject | -- | -- |
| 读段提取和处理 | samtools | -- | -- |
| 覆盖度向量计算 | gafpack | -- | -- |
| 低复杂度节点过滤 | Panplexity | -- | -- |
| 组装质量注释 | FLAGGER | -- | -- |
| 古DNA模拟 | AncestralSim | -- | -- |
| 古DNA读段模拟 | Gargammel | -- | -- |
| 群体历史模拟 | msprime | -- | -- |
| 接头修剪 | fastp | -- | -- |
| 编辑距离计算 | edlib | -- | -- |
| HLA型别注释 | ImmuAnnot | -- | -- |
| HLA基因分型 | T1K | -- | -- |
| HLA插补 | HLA*IMP:02 | -- | -- |
| 结构变异检测 | svim-asm | -- | -- |
| 蛋白到基因组比对 | Miniprot | -- | -- |
| 基因图构建 | Pangene | -- | -- |
| 工作流管理 | Snakemake v7 | -- | -- |
| 容器化 | Singularity/Apptainer | -- | -- |
| 环境管理 | Conda | -- | -- |
| 覆盖度计算 | mosdepth | -- | -- |
| 亲缘关系估计 | somalier | -- | -- |
| 污染估计 | SCE-VCF v0.1.2 | -- | -- |
| 变异处理 | bcftools | -- | -- |
| 标记重复 | GATK标记重复 | -- | -- |
| 变异检测 | DeepVariant | -- | -- |
| HLA分型验证 | Affymetrix SNP芯片IDEA-900k | Affymetrix | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 泛基因组图构建与单倍型组装 | 组装来源(HPRCy1:38个二倍体组装,HGSVCv3:65个二倍体组装)、补充参考(CHM13和GRCh38)、PGGB参数(--n-mappings 2,--min-match-len 101)、FLAGGER排除区域 阅读提示:Methods中Assembly selection及Region-of-interest pangenome graph construction小节 |
| 低覆盖度基准测试 | 覆盖度水平(30X、5X、2X、1X)、降采样参数(-s 42.0333, -s 42.0667, -s 42.1667)、样本量(38个HPRCy1短读长样本)、目标位点数(326 CMRGs,265 SVs)、比较方法(Locityper v1.2.0) 阅读提示:Methods中Leave-zero-out: CMRGs和Leave-zero-out: SVs小节,以及Fig. 2A |
| aDNA模拟 | 模拟读取数(1X和2X)、片段长度(70 bp)、读长(100 bp)、污染水平(0%或10%)、脱氨损伤类型(单链)、比对的参数(bwa aln -l 16500 -n 0.01 -o 2) 阅读提示:Methods中Leave-zero-out: aDNA simulations of 48 CMRGs小节,以及Additional file 1: Fig. S12–S13 |
| HLA分型与验证 | 队列样本量(1,085例Moli-sani样本)、覆盖度(平均20X)、测序平台(Illumina NovaSeq 6000,150PE)、HLA基因(HLA-A, -B, -C, -DPA1, -DPB1, -DQA1, -DQB1)、参考数据库(ImmuAnnot Zenodo记录10948964)、验证方法(HLA*IMP:02和T1K v1.0.8-r237) 阅读提示:Methods中Benchmarking: HLA typing小节,以及Additional file 1: Figs. S18–S19 |
| 节点过滤与基因型推断 | 低复杂度节点过滤参数(Panplexity -w 100 -d 100 -k 16)、覆盖度离群节点阈值([Q1-1.5×IQR, Q3+1.5×IQR])、余弦相似度差值阈值示例(0.002) 阅读提示:Methods中Node filtering和Genotype inference via cosine similarity小节,以及Additional file 1: Fig. S20 |