全基因组测序与数据质控
获取西班牙裔/拉丁裔人群的遗传数据,并进行质控以用于后续分析。
对13,025名HCHS/SOL参与者的血液DNA进行全基因组测序(TOPMed和CCDG项目),使用DRAGEN流程进行等位基因调用,基因组版本为hg38;使用PC-AiR和PC-Relate计算遗传主成分和亲缘关系,并筛选无关个体(亲缘系数<0.044)。
Novel genetic profile linked to cognitive decline in Hispanics/Latinos
基于WGS的k-mer聚类分析,关联分析使用SOL-INCA认知结局,但无独立功能验证或体内模型验证。
13,025名西班牙裔/拉丁裔成年人全基因组测序数据(HCHS/SOL) SOL-INCA队列(n = 5334)认知结局分析
APOE区域k-mer聚类数(k=3) 认知结局分析样本量(MCI n=5236,显著认知衰退 n=5317) 关联分析校正变量:基线年龄、教育、性别、研究中心、随访时间、测试语言 k-mer长度k=21,敏感性分析k=17和k=25 聚类3与显著认知衰退的OR=1.47,95% CI [1.18, 1.84],p<0.001
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
获取西班牙裔/拉丁裔人群的遗传数据,并进行质控以用于后续分析。
对13,025名HCHS/SOL参与者的血液DNA进行全基因组测序(TOPMed和CCDG项目),使用DRAGEN流程进行等位基因调用,基因组版本为hg38;使用PC-AiR和PC-Relate计算遗传主成分和亲缘关系,并筛选无关个体(亲缘系数<0.044)。
获取APOE基因区域及侧翼区域的短基因组序列(k-mer)谱,用于后续聚类分析。
将WGS数据子集化为APOE区域(chr19:44,905,781–44,909,394,GRCh38)及每侧500,000 bp侧翼区域(总区域chr19:44,405,781–45,409,394);使用Beagle v5.2进行定相;使用samtools和BCFtools生成每个体的FASTA序列;使用Jellyfish进行k-mer计数,k=21,使用规范k-mer计数(-C)和最小频率阈值2(-L 2)。
识别具有相似APOE区域k-mer谱的个体群体(聚类)。
对k-mer计数进行主成分分析(PCA),使用k-means聚类(基于前2或前6个主成分,分别使用在100%或80%随机子样本中SD非零的k-mer集),并进行共识聚类生成最终聚类分配。
评估APOE k-mer聚类与MCI和显著认知衰退的关联,并与常规APOE等位基因的关联进行比较。
使用survey R包进行调查逻辑回归,以聚类1为参照,估计聚类2和3与MCI和显著认知衰退的OR;同时估计APOE ε2和ε4等位基因(以ε3为参照)与这些结局的关联;模型校正基线年龄、教育、性别、研究中心、随访时间、测试语言。
评估k-mer长度选择、控制区域和替代变量对主要关联结果的影响。
使用k=17和k=25重复k-mer分析流程;在三个控制区域(chr19:48,405,781–49,409,394;chr18:44,405,781–45,409,394;chr17:44,405,781–45,409,394)重复分析,使用k=25;使用第一个k-mer计数主成分(PC1)和最高载荷k-mer进行关联分析。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 全基因组测序 | Illumina DRAGEN流程 | -- | -- |
| 定相 | Beagle版本5.2 | -- | -- |
| k-mer计数 | Jellyfish | -- | -- |
| 序列索引和FASTA生成 | samtools | -- | -- |
| BCFtools | -- | -- | |
| 遗传 ancestry 估计 | ADMIXTURE软件 | -- | -- |
| RFMix44 | -- | -- | |
| 关联分析 | survey R包52, 53 | -- | -- |
| 遗传相关性和主成分分析 | GENESIS R包 | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 全基因组测序与数据质控 | 样本来源:13,025名HCHS/SOL参与者;测序平台:TOPMed和CCDG项目,Baylor College of Medicine HGSC;基因组版本:hg38;无关个体筛选:亲缘系数<0.044 阅读提示:Methods 2.2 Whole-genome sequencing |
| APOE区域k-mer谱生成 | 基因组区域:chr19:44,405,781–45,409,394(GRCh38);k-mer长度:21;最小频率阈值:2;定相软件:Beagle v5.2 阅读提示:Methods 2.4 K-mer analysis in APOE gene surrounding region |
| 基于k-mer谱的聚类推导 | 用于PCA的k-mer集:在100%或80%随机子样本中SD非零;聚类数:3;聚类方法:k-means和共识聚类 阅读提示:Methods 2.5 Derivation of k-mer profile-based clusters 和 Figure 1 |
| APOE k-mer聚类与认知结局的关联分析 | MCI分析样本量:n=5236;显著认知衰退分析样本量:n=5317;校正变量:基线年龄、教育、性别、研究中心、随访时间、测试语言;参照组:聚类1 阅读提示:Methods 2.7 Statistical analysis 和 Table 3 |
| 敏感性分析 | k值:17和25;控制区域:chr19:48,405,781–49,409,394,chr18:44,405,781–45,409,394,chr17:44,405,781–45,409,394 阅读提示:Methods 2.8 Sensitivity analyses to k-mer analysis 和 Table S2 |