COSIGT:利用泛基因组图从低覆盖度测序数据中对复杂位点进行群体可扩展的基因分型

COSIGT: population-scalable genotyping of complex loci from low-coverage sequencing data using pangenome graphs

作者信息Davide Bolognini, Andrea Guarracino, Chiara Paleni, Thomas S Dudley, Licia Iacoviello, Alessandro Raveane, Peter H Sudmant, Erik Garrison, Nicole Soranzo
PMID42711702
发布时间2026-09-08
DOI10.1186/s13059-026-04242-4

实验完整度

包含方法学算法开发、多覆盖度基准测试、aDNA模拟、HLA分型及Moli-sani队列验证,含功能与机制验证

主要模型

1000 Genomes Project短读长样本(326 CMRGs及265 SVs) HPRCy1及HGSVCv3单倍型解析组装(泛基因组图构建) 模拟古DNA(aDNA)样本(1X/2X,0%或10%污染) Moli-sani队列1,085例短读长全基因组样本(HLA分型)

重点核对

泛基因组图构建:HPRCy1(38个二倍体组装)与HGSVCv3(65个二倍体组装)单倍型解析组装,补充CHM13和GRCh38参考 低覆盖度基准:CMRGs在30X、5X、2X、1X覆盖度下与Locityper比较QVpred,1X/2X下COSIGT错误率显著降低 aDNA模拟:48个CMRGs,1X和2X覆盖度,0%或10%污染,平均片段长度70 bp,读长100 bp,单链脱氨损伤 Leave-all-out基准:真实单倍型排除于泛基因组图,CMRGs和SVs在30X下QVfrac评估 HLA分型验证:1,085例Moli-sani样本,与HLA*IMP:02及T1K比较,单倍型水平准确率89.5%

摘要

泛基因组图捕获了广泛的结构多样性,但从浅测序数据中解析复杂位点仍然具有挑战性,尤其是当样本质量较低时,例如古DNA。我们介绍COSIGT(基于余弦相似度的基因分型器),它通过余弦相似度将读段深度分布与单倍型路径进行匹配来分配二倍体基因型。由于该度量评估的是相对覆盖度分布而非绝对读段计数,COSIGT在低覆盖度(1-2X)下大幅优于现有的基于似然的方法。我们展示了其对数千个现代和古代基因组的可扩展性,使得能够直接从低覆盖度数据集中对复杂变异进行稳健的群体规模分析。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
如何从低覆盖度测序数据(包括古DNA)中对结构复杂的基因组位点进行准确、可扩展的二倍体基因分型?
核心机制
COSIGT通过余弦相似度比较读段覆盖度向量与候选二倍体单倍型覆盖度向量的方向而非幅度,该度量对覆盖度变化不敏感,从而在低深度下保持稳健。
主要证据
在326个CMRGs和265个SVs上,COSIGT在1X覆盖度下93.4%的调用达到中等或更高质量,而Locityper为84.5%;在模拟aDNA中COSIGT在1X下维持约94%中等或更高质量,Locityper降至约46%;在1,085例Moli-sani样本HLA分型中单倍型水平准确率达89.5%。
研究意义
使研究人员能够系统地挖掘历史数据集和考古样本,实现群体水平的生物医学和进化分析,并适用于低覆盖度aDNA数据及覆盖度不均的大规模生物样本库。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

泛基因组图构建与位点边界优化

为目标位点构建局部泛基因组图,并优化位点边界以最大化保留单倍型覆盖

使用minimap2将单倍型组装比对至参考染色体,通过impg进行坐标liftover和过滤,bedtools提取序列,PGGB构建局部泛基因组图,ODGI进行图操作,FLAGGER标注的低质量区域被排除

2

未比对读段招募与短读段比对

降低参考偏差,召回未能比对到参考基因组但可能比对到替代单倍型的读段,并将所有读段投影到泛基因组图

使用Meryl构建k-mer数据库(k=31),kfilt通过分层索引(Bloom filter、哈希表、BK树)招募含至少一个精确k-mer匹配的未比对读段,samtools提取目标区域读段,bwa-mem2比对到单倍型序列,gfainject将比对投影到泛基因组图

3

覆盖度向量计算与基因型推断

计算样本和单倍型的节点覆盖度向量,通过余弦相似度识别最可能的二倍体基因型

gafpack将GAF比对转换为每节点长度归一化、多比对加权的覆盖度向量;odgi paths -H生成单倍型拷贝数向量;枚举所有二倍体单倍型对,求和得到候选基因型向量;计算样本向量与候选基因型向量的余弦相似度,选择相似度最高的单倍型对作为预测基因型

4

基准测试与性能评估

在多个覆盖度、数据集和模拟条件下评估COSIGT相对于Locityper的基因分型准确性

在1000G短读长样本中,对326个CMRGs和265个SVs进行leave-zero-out和leave-all-out基准测试;模拟aDNA(1X/2X,0%/10%污染);在Moli-sani队列中进行HLA分型并与HLA*IMP:02和T1K比较;使用QVpred、QVfrac和错误率评估性能

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
PGGB----
ODGI----
minimap2----
impg----
bedtools----
kfilt----
Meryl----
bwa-mem2----
bwa aln----
gfainject----
samtools----
gafpack----
Panplexity----
FLAGGER----
AncestralSim----
Gargammel----
msprime----
fastp----
edlib----
ImmuAnnot----
T1K----
HLA*IMP:02----
svim-asm----
Miniprot----
Pangene----
Snakemake v7----
Singularity/Apptainer----
Conda----
mosdepth----
somalier----
SCE-VCF v0.1.2----
bcftools----
GATK标记重复----
DeepVariant----
Affymetrix SNP芯片IDEA-900kAffymetrix--

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
泛基因组图构建与单倍型组装
组装来源(HPRCy1:38个二倍体组装,HGSVCv3:65个二倍体组装)、补充参考(CHM13和GRCh38)、PGGB参数(--n-mappings 2,--min-match-len 101)、FLAGGER排除区域
阅读提示:Methods中Assembly selection及Region-of-interest pangenome graph construction小节
低覆盖度基准测试
覆盖度水平(30X、5X、2X、1X)、降采样参数(-s 42.0333, -s 42.0667, -s 42.1667)、样本量(38个HPRCy1短读长样本)、目标位点数(326 CMRGs,265 SVs)、比较方法(Locityper v1.2.0)
阅读提示:Methods中Leave-zero-out: CMRGs和Leave-zero-out: SVs小节,以及Fig. 2A
aDNA模拟
模拟读取数(1X和2X)、片段长度(70 bp)、读长(100 bp)、污染水平(0%或10%)、脱氨损伤类型(单链)、比对的参数(bwa aln -l 16500 -n 0.01 -o 2)
阅读提示:Methods中Leave-zero-out: aDNA simulations of 48 CMRGs小节,以及Additional file 1: Fig. S12–S13
HLA分型与验证
队列样本量(1,085例Moli-sani样本)、覆盖度(平均20X)、测序平台(Illumina NovaSeq 6000,150PE)、HLA基因(HLA-A, -B, -C, -DPA1, -DPB1, -DQA1, -DQB1)、参考数据库(ImmuAnnot Zenodo记录10948964)、验证方法(HLA*IMP:02和T1K v1.0.8-r237)
阅读提示:Methods中Benchmarking: HLA typing小节,以及Additional file 1: Figs. S18–S19
节点过滤与基因型推断
低复杂度节点过滤参数(Panplexity -w 100 -d 100 -k 16)、覆盖度离群节点阈值([Q1-1.5×IQR, Q3+1.5×IQR])、余弦相似度差值阈值示例(0.002)
阅读提示:Methods中Node filtering和Genotype inference via cosine similarity小节,以及Additional file 1: Fig. S20