基于联盟数据的肺癌跨组学基因-吸烟交互作用研究

A trans-omics gene-smoking interaction study of lung cancer based on consortium data

作者信息Ning Xie, Xiaowen Xu, Yanru Wang, Aoxuan Wang, Xiang Wang, Xuan Wang, Mengsheng Zhao, Jiacheng Zhou, Yongyue Wei, Manel Esteller, Zhibin Hu, Hongbing Shen, Rayjean J Hung, Christopher I Amos, Yi Li, David C Christiani, Feng Chen, Yang Zhao, Ruyang Zhang
PMID41738161
发布时间2026-06-01
DOI10.1093/ajrccm/aamaf097

实验完整度

包含了多组学数据整合、两阶段验证(发现与复制)、分子修饰评分构建及跨组学整合分析等多个独立证据层级,并进行了敏感性分析和亚组分析,体现了较高的实验完整度。

主要模型

欧洲血统人群(ILCCO-OncoArray、TRICL、PLCO、UKB) DNA甲基化、基因表达、蛋白质、代谢物分子特征 LDpred2预测的分子性状模型

重点核对

发现阶段:ILCCO-OncoArray(16 606例病例 vs 13 905例对照) 复制阶段:TRICL、PLCO、UKB(共11 131例病例 vs 435 005例对照) 交互作用检测模型:logistic回归,调整年龄、性别、基因分型平台和10个遗传主成分 统计显著性标准:发现阶段q-FDR≤0.05,复制阶段P≤0.05且效应方向一致 MMS构建:基于5个弱相关生物标志物的效应权重,来自4个数据集荟萃分析

摘要

理由:基因预测的分子特征为识别生物标志物和揭示潜在生物学机制提供了一种经济有效的方法。我们扩展了这一框架来研究肺癌易感性中的基因-吸烟交互作用。目标:识别影响肺癌风险的跨组学基因-吸烟交互作用,并评估生物标志物如何改变吸烟效应。方法:我们通过整合来自国际肺癌OncoArray联盟(ILCCO-OncoArray)、肺癌跨学科研究(TRICL)、前列腺、肺、结直肠和卵巢癌筛查试验(PLCO)以及英国生物银行(UKB)的联盟级个体基因型数据(27 737例病例对449 910例非病例),与基于联盟的汇总级分子数量性状位点(xQTL)数据(涉及DNA甲基化、基因表达、蛋白质和代谢物),开展了首个肺癌跨组学基因-吸烟交互作用研究。基于已识别的生物标志物,我们开发了一种分子修饰评分(MMS)来描绘基因-吸烟交互作用模式,并对吸烟者进行肺癌高风险分层。测量和主要结果:通过两阶段分析策略,识别出8个与吸烟显著交互作用的生物标志物,包括烟碱型乙酰胆碱受体区域内的CpG位点和基因RP11-326C3.14。MMS通过整合这些生物标志物及其来自所有可用数据集荟萃分析得到的效应估计值,有效地对吸烟者中的肺癌风险进行了分层。跨组学整合分析揭示了跨分子层的功能关系,特别涉及NELFE基因在吸烟相关致癌通路中的作用。结论:跨组学关联研究(xWAS)框架能够系统性地发现跨组学基因-环境交互作用。MMS有效描绘了交互效应的模式并促进风险分层。此外,我们推出了一个免费的在线平台LungCancer-xWAS-GxE(http://bigdata.njmu.edu.cn/LungCancer-xWAS-GxE/)。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
遗传预测的分子特征能否与吸烟暴露交互影响肺癌风险,并识别出可修饰吸烟效应的关键生物标志物?
核心机制
识别出的生物标志物(如CpG位点和RP11-326C3.14)与吸烟暴露的交互作用可能通过调控基因表达或表观遗传修饰影响肺癌风险;跨组学整合分析提示NELFE基因可能参与吸烟相关致癌通路。
主要证据
基于4个大型联盟数据(27 737例病例 vs 449 910例非病例)整合xQTL数据,通过两阶段分析识别出8个显著交互的生物标志物,并构建MMS有效分层吸烟者风险。
研究意义
该研究提供了跨组学基因-吸烟交互作用的系统证据,并开发了在线平台以共享分析结果,为肺癌高风险个体的精准预防和干预提供了工具。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

数据整合与质量控制和分子特征预测

整合个体基因型数据和xQTL数据,预测多种分子生物标志物,用于后续交互作用分析。

整合ILCCO-OncoArray、TRICL、PLCO和UKB的个体基因型数据(27 737例病例和449 910例对照),以及来自GoDMC、eQTLGen、Ferkingstad等和Shin等的xQTL汇总数据,使用LDpred2预测DNA甲基化、基因表达、蛋白质和代谢物水平,仅保留后验遗传力≥0.01的生物标志物。

2

两阶段基因-吸烟交互作用分析

在发现和复制阶段验证分子特征与吸烟(包年)交互对肺癌风险的影响。

在ILCCO-OncoArray中测试交互作用(发现阶段),在TRICL、PLCO和UKB中验证(复制阶段)。使用logistic回归模型,调整年龄、性别、基因分型平台和前10个遗传主成分,检验分子特征与吸烟包年的交互项。

3

敏感性分析和亚组分析

评估交互作用的稳健性,并探讨在不同亚组中的特异性。

使用吸烟状态替代包年作为环境暴露进行敏感性分析;按性别和组织学类型(LUAD和LUSC)进行亚组分析,检验交互作用在不同亚组中的一致性或特异性。

4

分子修饰评分(MMS)构建和风险分层

量化分子特征对吸烟效应的修饰作用,并基于MMS对吸烟者进行肺癌风险分层。

从8个显著生物标志物中选取5个弱相关(Pearson ρ≤0.7)的,以荟萃分析效应为权重构建MMS。根据MMS三分位数将人群分为低、中、高三组,分别评估吸烟包年与肺癌风险的关联,并在UKB中预测不同年龄和性别的肺癌发病率。

5

跨组学整合分析

识别不同组学层(DNA甲基化→基因表达→蛋白质→代谢物)之间相关的生物标志物路径,并评估其与吸烟的交互作用。

计算不同组学层预测生物标志物之间的相关性,筛选q-FDR≤0.05且Pearson ρ>0.3的显著相关对,构建从CpG位点到基因表达、蛋白质和代谢物的分子路径,并检验这些相关性是否对肺癌风险与吸烟的交互有贡献。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

分子特征预测
基因-环境交互作用分析
跨组学整合分析

产品清单

实验环节名称品牌货号
LDpred2----
PLINK 2.0----
TOPMed填补服务器----
R v4.3.0----
KING----
LiftOver----
bigsnprR package--
metaforR package--

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据整合与质量控制
个体基因型数据来源(ILCCO-OncoArray、TRICL、PLCO、UKB)及质量控制程序;xQTL数据来源(GoDMC、eQTLGen、Ferkingstad等、Shin等)及样本量;保留欧洲血统且遗传无关的个体。
阅读提示:Methods部分'Consortium-scale individual GWAS data'和'Alliance-based summary-level quantitative trait loci data'
分子特征预测
LDpred2参数(例如'sparse'选项);后验遗传力阈值(h²≥0.01);使用的xQTL汇总统计和LD参考面板。
阅读提示:Methods部分'Molecular trait prediction models'
两阶段交互作用分析
发现阶段和复制阶段的数据集分配;logistic回归模型协变量(年龄、性别、基因分型平台、前10个遗传主成分);交互项定义(分子特征×包年);显著性标准(q-FDR≤0.05和P≤0.05)。
阅读提示:Methods部分'Association testing for xWAS'
敏感性分析
吸烟状态分类(当前/曾经/从不);是否使用与主要分析相同的协变量和显著性阈值。
阅读提示:Methods部分'Association testing for xWAS'中的敏感性分析描述
分子修饰评分构建
选取的生物标志物(cg13714459, cg13561554, cg26989927, cg15034267, RP11-326C3.14);相关性排除标准(Pearson ρ>0.7);效应权重来源(荟萃分析);三分位数分组。
阅读提示:Methods部分'Molecular modifying score'
跨组学整合分析
相关性阈值(q-FDR≤0.05且Pearson ρ>0.3);起始CpG位点选择标准;构建路径的步骤。
阅读提示:Methods部分'Trans-omics integrative analysis'