社会脱离整合了自杀意念和抑郁症中的遗传与蛋白质组风险

Social disconnection integrates genetic and proteomic risks in suicidal ideation and depression

作者信息Sihong Li, Zhongting Huang, Hui Chen, Xianliang Chen, Huajia Tang, Yanyue Ye, Jijun Zhu, Shenghan Wang, Pan Li, Shunjie Zhang, Haowen Zhuang, Weixin Liu, Fuqiang Cai, Zhijian Song, Yuxin Liu, Jiansong Zhou, Junfang Chen
PMID42706232
发布时间2026-09-07
DOI10.1038/s41398-026-04276-z

实验完整度

研究包含多个独立证据层级:横断面关联分析、机器学习分类、纵向预测、基因-环境交互分析以及结构方程模型中介分析,并基于大规模人群队列(UK Biobank),包含功能验证。

主要模型

UK Biobank 参与者(13085人) UK Biobank 匹配蛋白质组数据的亚队列(1353人)

重点核对

自杀意念定义:自我报告‘生命不值得活’(Field IDs 20479, 29108) 抑郁症定义:基于CIDI访谈,排除自伤/自杀行为个体 社会联系/PRS/蛋白质组的缺失值处理与质量控制 多基因风险评分(MDD-PRS和SA-PRS)的构建和阈值选择(P≤1) 机器学习分类器及特征选择(Wilcoxon检验)和交叉验证方法(十次五折)

摘要

自杀意念(SI)和重度抑郁症(MDD)是由遗传易感性、分子过程和社会心理因素相互作用引起的复杂精神疾病。虽然这些维度已被广泛单独研究,但它们对SI和MDD的共同贡献仍不清楚。本研究整合多模态数据以阐明这些协同效应,并为个体水平风险分层开发稳健模型。利用来自13085名英国生物银行参与者的纵向多模态数据,我们整合了基因组、蛋白质组和社会联系资料。我们使用严格的监督机器学习框架(涵盖多种线性和集成分类器)开发了可解释的风险评分。采用置换重要性量化特征贡献,并衍生出跨多种分类器的透明、加权风险指标。这些评分通过关联、交互和中介分析得到验证。基于社会联系的风险评分在两个自杀意念表型(2017年和2023年)的横断面分析中显著区分病例和对照(AUC:0.70-0.73),优于仅蛋白质组模型。社会联系的功能维度成为最具信息量的预测因子。纵向分析显示,基线时的社会风险评分预测了六年后的自杀意念发作,与人口统计学协变量无关。交互分析表明,自杀尝试的多基因风险与社会和蛋白质组风险特征在抑郁症方面显著交互。结构方程模型进一步证实,社会脱离是连接遗传易感性与MDD和SI的关键中介因素。社会脱离是介导遗传脆弱性对精神结果影响的关键风险因素。整合社会、遗传和分子数据支持多层级风险分层框架,并强调以社会为导向的干预措施在减轻生物学风险方面的潜力。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
社会联系(结构、功能、质量维度)、遗传易感性和蛋白质组特征如何共同影响自杀意念(SI)和抑郁症(MDD)的风险,以及社会联系是否介导或调节遗传风险。
核心机制
社会脱离(特别是功能维度)是介导多基因风险与SI和MDD之间关系的关键中介因素;SA-PRS与社会及蛋白质组风险在MDD风险中显著交互,但蛋白质组未显示中介作用。
主要证据
基于UK Biobank的13,085名参与者的横断面和纵向关联分析(logistic回归)、机器学习分类(AUC 0.70-0.73)、交互分析(β=0.417,Padj=8.11×10-3)和结构方程模型(间接效应a×b=0.046-0.107,Padj<1×10-300)证实。
研究意义
该研究支持多层级风险分层框架,并强调针对社会联系的干预措施可能在减轻遗传脆弱性方面具有潜力。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

定义样本和表型

从UK Biobank中筛选参与者,并定义SI和MDD病例与对照。

根据CIDI定义抑郁症,排除自伤/自杀行为,并根据问卷调查定义SI。

2

基因和蛋白质组数据预处理

处理基因分型、PRS计算及蛋白质组数据的缺失值。

对基因数据进行QC,计算PRS,并对蛋白质组数据进行缺失值插补(KNN)。

3

社会联系因素与目标表型的关联分析

识别与社会联系相关的因素,并评估它们与SI和MDD的关联。

使用logistic回归分析23个社会联系变量与SI和MDD的关联。

4

构建风险评分预测模型

基于社会联系或蛋白质组特征开发分类模型,用于区分SI和MDD的病例与对照。

使用特征选择(Wilcoxon检验)和多种机器学习分类器进行交叉验证,选择最佳模型并预测风险评分。

5

评估风险评分的判别能力

比较基于社会联系和蛋白质组的风险评分在区分病例和对照方面的性能。

使用AUC评估模型性能,并比较不同特征集的AUC。

6

纵向预测和轨迹分析

评估基线风险评分预测未来SI发作的能力。

分析2017年风险评分与2023年SI状态间的关联,比较不同轨迹组间的差异。

7

交互分析

检验PRS与风险评分之间的交互作用是否影响SI和MDD。

在logistic回归模型中引入PRS与风险评分的交互项,评估显著性。

8

中介分析

评估社会联系和蛋白质组特征是否介导遗传风险与SI/MDD之间的关联。

使用结构方程模型构建潜在变量,进行中介效应检验。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
Olink Explore 3072平台Olink--
UK BiLEVE Axiom芯片----
UK Biobank Axiom芯片----
PLINK2----
PRSice----
R impute包----
statsmodels----
LightGBM----
scikit-learn----
semopy----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
样本选择
参与者来自UK Biobank,排除撤回同意的377人,并基于MDD或对照标准筛选,最终样本量13,085,均无抑郁症和SI病史。
阅读提示:Methods: Study population
表型定义
SI基于Field ID 20479和29108('觉得生命不值得活')在2017和2023年评估;MDD基于CIDI诊断,排除自伤和自杀行为。
阅读提示:Methods: Definition of suicide ideation and depression
基因型与PRS计算
基因QC标准:基因型缺失率>0.02、样本缺失率>0.02、杂合度异常、HWE检验P<1×10-10、MAF<0.001、亲缘系数>0.0442;PRS基于PGC GWAS,使用PRSice剪枝,阈值P≤1。
阅读提示:Methods: Genotyping and PRS calculation
环境暴露测量
23个社会联系相关自报问卷题,涵盖功能、结构、质量模块;'退休时'(Field ID 29170)需重编码为0/1以反映2017年前后退休状态。
阅读提示:Methods: Assessment of social connection-related phenotypes and Supplementary Table S1
蛋白质组学数据预处理
排除缺失率>20%的蛋白质;使用KNN插补缺失值(impute.knn函数默认参数)。
阅读提示:Methods: Data preprocessing
关联分析
logistic回归调整年龄和性别,以及前10个遗传主成分;FDR校正α=0.05。
阅读提示:Methods: Statistical analysis
机器学习模型
特征选择采用Wilcoxon秩和检验,取前K个特征(K=23用于社会特征;蛋白质特征K∈{3,5,10,50,100,300,500,800,1000,1500,2500,2911});模型训练采用十次五折交叉验证,在训练折内进行预处理和特征选择;最终每个模型选择最佳AUC。
阅读提示:Methods: Machine-learning classification models
交互分析
交互项分别由社会联系风险评分和蛋白质组风险评分与PRS(SA-PRS, MDD-PRS)相乘;模型调整年龄、性别、前十遗传主成分。
阅读提示:Methods: Interaction modelling between risk scores and polygenic risk
中介分析
结构方程模型采用semopy包;遗传风险潜在变量由MDD-PRS和SA-PRS组成;社会联系潜在变量由各模块最重要变量组成;蛋白质组潜在变量由每个结果的特征重要性前两名组成;评估直接和间接效应用10000次bootstrap。
阅读提示:Methods: Mediation analyses via structural equation modelling