近完全的中东基因组细化纯合性并增强致病性和群体特异性变异的发现

Near-complete Middle Eastern genomes refine autozygosity and enhance disease-causing and population-specific variant discovery

作者信息Mohammadmersad Ghorbani, Shabir Moosa, Zenab Siddig, Radi Farhad, Haroon Naeem, William T Harvey, Francesco Kumara Mastrorosa, Katherine M Munson, Rozaimi Mohamad Razali, Elbay Aliyev, Ilhame Diboun, Rawan Abouelhassan, Melissa Tauro, Sondoss Hassan, Rebecca Mathew, Muna Al Hashmi, Lisa S Mathew, Kun Wang, Abdul Rahman Salhab, Fazulur Rehaman Vempalli, Ahmed El Khouly, Qatar Genome Program Research Consortium, Iman Alazwani, Sara Tomei, Khalid A Fakhro, Alia Satti, Ruba Benini, Arang Rhie, Evan E Eichler, Younes Mokrab, Said I Ismail, Wadha Al-Muftah, Radja Badji, Hamdi Mbarek, Dima Darwish, Tasnim Fadl, Heba Yasin, Maryem Ennaifar, Rania Abdellatif, Fatima Alkuwari, Muhammad Alvi, Yasser Al-Sarraj, Chadi Saad, Asmaa Althani, Eleni Fethnou, Fatima Qafoud, Eiman Alkhayat, Nahla Afifi, Wei Liu, Stephan Lorenz, Najeeb Syed, Hakeem Almabrazi, Ramzi Temanni, Tariq Abu Saqri, Mohammedhusen Khatib, Mehshad Hamza, Tariq Abu Zaid, Tushar Pathare, Shafeeq Poolat, Rashid Al-Ali, Omar Albagha, Souhaila Al-Khodor, Mashael Alshafai, Ramin Badii, Lotfi Chouchane,
PMID40325133
期刊Nat Genet
发布时间2025-05
DOI10.1038/s41588-025-02173-7

实验完整度

包括基因组组装、变异调用、ROH分析、HLA/KIR注释、家族三人组分析等多个实验层级,并进行了功能相关的变异候选鉴定。

主要模型

6个中东家庭三人组(n=18) PacBio HiFi长读长及Illumina短读长测序

重点核对

样本来源:来自苏丹、约旦、叙利亚、卡塔尔和阿富汗的六组三人组 测序覆盖度:PacBio HiFi平均38.8×(儿童)和37.2×(父母),Illumina短读长31-38× 变异调用方法:基于组装的PAV与基于读取的DeepVariant的对比 ROH分析:使用Automap基于PAV变异调用 候选变异筛选标准:AF<0.01,ACMG分类,基因-表型关联

摘要

长读长测序的进展使得人类基因组的常规完整组装成为可能,但在代表更广泛的人群并展示对疾病基因发现的影响方面仍有很多工作要做。在此,我们报告了来自六个中东(ME)家庭三人组(n=18)的高精度、近完全且分型的基因组,这些家庭患有神经发育疾病,代表了来自苏丹、约旦、叙利亚、卡塔尔和阿富汗的血统。这些基因组揭示了42.2 Mb的新序列(13.8%影响已知基因),75个新的HLA/KIR等位基因,以及强烈的近交信号,其中一人的ROH覆盖了6号和12号染色体的三分之一。利用基于组装的变异调用,我们确定了23个新发和隐性变异作为先证者中先前未解决症状的强候选原因。ME基因组相对于现有参考揭示了独特的变异,显示出增强的可映射性和变异调用。这些结果强调了从头组装在疾病变异发现中的价值,以及需要采样的ME特异性参考来更好地表征人群相关变异。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
该研究旨在利用高精度基因组组装技术,解析中东人群的基因组结构变异和纯合性特征,并鉴定导致神经发育疾病的遗传变异。
核心机制
中东人群的高度近交和纯合性增加了隐性致病变异的可能性,而新发变异在发育障碍中亦发挥重要作用。
主要证据
基于六个三人组的组装分析,在42.2 Mb新序列中鉴定出23个候选变异,其中两个在ACMG指南下被分类为致病性,一个为可能致病性,并通过与参考基因组的对比验证了组装方法的优势。
研究意义
该研究强调了构建种群特异性参考基因组(如中东泛基因组)的必要性,以提高变异检测的准确性,并改善对未诊断疾病的遗传诊断。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

样本收集与测序

获取高质量的遗传数据以进行基因组组装和变异分析。

从六个中东家庭三人组收集外周血样本,提取DNA,进行PacBio HiFi长读长和Illumina短读长测序。

2

基因组从头组装与质量评估

生成高质量的相控基因组组装,并验证其准确性和完整性。

使用trioHifiasm进行从头组装,利用亲子短读长数据辅助分型,并使用Merqury、Flagger等工具评估质量。

3

变异检测与分析

识别基因组中的SNV、indels和结构变异,并评估其功能影响。

使用PAV和DeepVariant进行组装和读取基础的变异调用,并与参考基因组比对,注释变异,并筛选候选致病变异。

4

纯合性(ROH)分析

评估近交程度,并关联基因内容。

使用Automap从PAV变异调用中识别ROH,计算ROH大小和基因含量,并比较不同个体的ROH模式。

5

HLA和KIR基因注释

识别新的HLA/KIR等位基因,理解免疫基因多样性。

使用Immuannot注释HLA和KIR基因,与参考数据库比较,并生成系统发育树。

6

家族三人组变异筛选

在受影响的儿童中鉴定候选致病变异。

基于家系分析,考虑 recessive 和 de novo 遗传模式,优先考虑罕见变异,并用ACMG指南分类。

7

种群参考评估

评估使用ME特定参考基因组对变异检测和可映射性的影响。

构建MER1参考(基于CHM13替换六个染色体),对比不同参考(GRCh38、CHM13、HG002、CN1)的读段映射和变异调用性能。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
QIAsymphony自动化工作站QIAGEN--
DSP DNA中量提取试剂盒QIAGEN--
NanoDrop 8000分光光度计Thermo Fisher Scientific--
Quant-iT PicoGreen双链DNA定量试剂Thermo Fisher Scientific--
LabChip GX微流控芯片PerkinElmer--
HiSeq X测序系统Illumina--
测序平台PacBio Sequel II101-894-200
SMRTbell文库制备试剂盒2.0PacBio100-938-900
MagAttract高分子量DNA提取试剂盒QIAGEN67563
Megaruptor 3片段化仪DiagenodeB06010003
Megaruptor 3片段化仪DiagenodeE07010003
PippinHT片段筛选系统Sage ScienceHPE7510
FEMTO Pulse脉冲场电泳系统AgilentM5330AA
DS-11 FX分光光度计DenovixQ32854
Liftoff注释工具----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
样本测序
样本来源、测序平台、覆盖深度、读长长度
阅读提示:Methods: Sequencing data generation and quality assessment
基因组组装
组装工具、亲本数据使用、质量指标
阅读提示:Methods: Genome assembly and quality assessment
变异检测
比对工具、变异调用软件、过滤标准
阅读提示:Methods: Variant calling
纯合性分析
ROH识别方法、参考基因组、ROH分类
阅读提示:Methods: ROH
候选变异筛选
遗传模式、频率阈值、功能预测评分、ACMG分类
阅读提示:Methods: Family trio analysis and variant prioritization
HLA/KIR注释
注释工具、参考数据库、新等位基因标准
阅读提示:Methods: Typing of HLA and KIR alleles