与西班牙裔/拉丁裔认知衰退相关的新遗传特征

Novel genetic profile linked to cognitive decline in Hispanics/Latinos

作者信息Yana Hrytsenko, Yogesh Purushotham, Zhirou Li, Carmen R Isasi, Wassim Tarraf, Alberto R Ramos, Martha L Daviglus, Humberto Parada Jr, Brian W Spitzer, Mariko Isshiki, Srilakshmi M Raj, Charles DeCarli, Hector M González, Myriam Fornage, Tamar Sofer
PMID42805940
发布时间2026-10
DOI10.1002/alz.71855

实验完整度

中

基于WGS的k-mer聚类分析,关联分析使用SOL-INCA认知结局,但无独立功能验证或体内模型验证。

主要模型

13,025名西班牙裔/拉丁裔成年人全基因组测序数据(HCHS/SOL) SOL-INCA队列(n = 5334)认知结局分析

重点核对

APOE区域k-mer聚类数(k=3) 认知结局分析样本量(MCI n=5236,显著认知衰退 n=5317) 关联分析校正变量:基线年龄、教育、性别、研究中心、随访时间、测试语言 k-mer长度k=21,敏感性分析k=17和k=25 聚类3与显著认知衰退的OR=1.47,95% CI [1.18, 1.84],p<0.001

摘要

背景:与非西班牙裔白人和东亚人群相比,APOE ε4等位基因在西班牙裔/拉丁裔人群中与ADRD结局的关联较弱。方法:我们使用来自13,025名西班牙裔/拉丁裔成年人的全基因组测序数据,从APOE基因区域的短DNA序列推断人群分组(聚类)。我们估计了这些聚类与轻度认知障碍(MCI)以及通过拉丁裔研究-神经认知衰老调查(SOL-INCA)(n = 5334)评估的年龄校正显著认知衰退之间的关联。我们将这些关联与常规APOE等位基因的关联进行了比较。结果:我们识别出三个个体聚类。相对于最大的聚类1,处于聚类3的个体发生显著认知衰退的可能性更高,比值比(OR)= 1.47,95%置信区间(CI)[1.18, 1.84],p < 0.001。与SOL-INCA检查时患有现患MCI的关联无统计学显著性,OR = 1.33,95% CI [0.97, 1.83],p = 0.08。ε4等位基因与这些特征的关联无统计学显著性。讨论:与ε4等位基因相比,新的APOE特征与SOL-INCA西班牙裔/拉丁裔中年龄校正显著认知衰退的风险关联更强。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
在西班牙裔/拉丁裔人群中,APOE基因区域的短基因组序列(k-mer)特征是否能识别出与认知衰退相关的遗传聚类,且该关联是否强于常规APOE等位基因?
核心机制
APOE区域短基因组序列(k-mer)定义的遗传聚类可能反映了与认知衰退风险相关的遗传结构,该结构不同于常规APOE等位基因。
主要证据
基于13,025名西班牙裔/拉丁裔成人的全基因组测序数据,通过k-mer谱主成分分析和k-means聚类识别出三个聚类;在SOL-INCA队列中,聚类3与年龄校正显著认知衰退的关联OR=1.47(95% CI 1.18-1.84,p<0.001),而APOE ε4关联无统计学显著性(OR=1.17,95% CI 0.98-1.41,p=0.08)。
研究意义
该研究提出了一种新的APOE区域遗传特征,其在西班牙裔/拉丁裔中与认知衰退的关联强于APOE ε4等位基因,可能有助于解释APOE等位基因关联的遗传异质性。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

全基因组测序与数据质控

获取西班牙裔/拉丁裔人群的遗传数据,并进行质控以用于后续分析。

对13,025名HCHS/SOL参与者的血液DNA进行全基因组测序(TOPMed和CCDG项目),使用DRAGEN流程进行等位基因调用,基因组版本为hg38;使用PC-AiR和PC-Relate计算遗传主成分和亲缘关系,并筛选无关个体(亲缘系数<0.044)。

2

APOE区域k-mer谱生成

获取APOE基因区域及侧翼区域的短基因组序列(k-mer)谱,用于后续聚类分析。

将WGS数据子集化为APOE区域(chr19:44,905,781–44,909,394,GRCh38)及每侧500,000 bp侧翼区域(总区域chr19:44,405,781–45,409,394);使用Beagle v5.2进行定相;使用samtools和BCFtools生成每个体的FASTA序列;使用Jellyfish进行k-mer计数,k=21,使用规范k-mer计数(-C)和最小频率阈值2(-L 2)。

3

基于k-mer谱的聚类推导

识别具有相似APOE区域k-mer谱的个体群体(聚类)。

对k-mer计数进行主成分分析(PCA),使用k-means聚类(基于前2或前6个主成分,分别使用在100%或80%随机子样本中SD非零的k-mer集),并进行共识聚类生成最终聚类分配。

4

APOE k-mer聚类与认知结局的关联分析

评估APOE k-mer聚类与MCI和显著认知衰退的关联,并与常规APOE等位基因的关联进行比较。

使用survey R包进行调查逻辑回归,以聚类1为参照,估计聚类2和3与MCI和显著认知衰退的OR;同时估计APOE ε2和ε4等位基因(以ε3为参照)与这些结局的关联;模型校正基线年龄、教育、性别、研究中心、随访时间、测试语言。

5

敏感性分析

评估k-mer长度选择、控制区域和替代变量对主要关联结果的影响。

使用k=17和k=25重复k-mer分析流程;在三个控制区域(chr19:48,405,781–49,409,394;chr18:44,405,781–45,409,394;chr17:44,405,781–45,409,394)重复分析,使用k=25;使用第一个k-mer计数主成分(PC1)和最高载荷k-mer进行关联分析。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
Illumina DRAGEN流程----
Beagle版本5.2----
Jellyfish----
samtools----
BCFtools----
ADMIXTURE软件----
RFMix44----
survey R包52, 53----
GENESIS R包----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
全基因组测序与数据质控
样本来源:13,025名HCHS/SOL参与者;测序平台:TOPMed和CCDG项目,Baylor College of Medicine HGSC;基因组版本:hg38;无关个体筛选:亲缘系数<0.044
阅读提示:Methods 2.2 Whole-genome sequencing
APOE区域k-mer谱生成
基因组区域:chr19:44,405,781–45,409,394(GRCh38);k-mer长度:21;最小频率阈值:2;定相软件:Beagle v5.2
阅读提示:Methods 2.4 K-mer analysis in APOE gene surrounding region
基于k-mer谱的聚类推导
用于PCA的k-mer集:在100%或80%随机子样本中SD非零;聚类数:3;聚类方法:k-means和共识聚类
阅读提示:Methods 2.5 Derivation of k-mer profile-based clusters 和 Figure 1
APOE k-mer聚类与认知结局的关联分析
MCI分析样本量:n=5236;显著认知衰退分析样本量:n=5317;校正变量:基线年龄、教育、性别、研究中心、随访时间、测试语言;参照组:聚类1
阅读提示:Methods 2.7 Statistical analysis 和 Table 3
敏感性分析
k值:17和25;控制区域:chr19:48,405,781–49,409,394,chr18:44,405,781–45,409,394,chr17:44,405,781–45,409,394
阅读提示:Methods 2.8 Sensitivity analyses to k-mer analysis 和 Table S2