定义样本和表型
从UK Biobank中筛选参与者,并定义SI和MDD病例与对照。
根据CIDI定义抑郁症,排除自伤/自杀行为,并根据问卷调查定义SI。
Social disconnection integrates genetic and proteomic risks in suicidal ideation and depression
研究包含多个独立证据层级:横断面关联分析、机器学习分类、纵向预测、基因-环境交互分析以及结构方程模型中介分析,并基于大规模人群队列(UK Biobank),包含功能验证。
UK Biobank 参与者(13085人) UK Biobank 匹配蛋白质组数据的亚队列(1353人)
自杀意念定义:自我报告‘生命不值得活’(Field IDs 20479, 29108) 抑郁症定义:基于CIDI访谈,排除自伤/自杀行为个体 社会联系/PRS/蛋白质组的缺失值处理与质量控制 多基因风险评分(MDD-PRS和SA-PRS)的构建和阈值选择(P≤1) 机器学习分类器及特征选择(Wilcoxon检验)和交叉验证方法(十次五折)
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
从UK Biobank中筛选参与者,并定义SI和MDD病例与对照。
根据CIDI定义抑郁症,排除自伤/自杀行为,并根据问卷调查定义SI。
处理基因分型、PRS计算及蛋白质组数据的缺失值。
对基因数据进行QC,计算PRS,并对蛋白质组数据进行缺失值插补(KNN)。
识别与社会联系相关的因素,并评估它们与SI和MDD的关联。
使用logistic回归分析23个社会联系变量与SI和MDD的关联。
基于社会联系或蛋白质组特征开发分类模型,用于区分SI和MDD的病例与对照。
使用特征选择(Wilcoxon检验)和多种机器学习分类器进行交叉验证,选择最佳模型并预测风险评分。
比较基于社会联系和蛋白质组的风险评分在区分病例和对照方面的性能。
使用AUC评估模型性能,并比较不同特征集的AUC。
评估基线风险评分预测未来SI发作的能力。
分析2017年风险评分与2023年SI状态间的关联,比较不同轨迹组间的差异。
检验PRS与风险评分之间的交互作用是否影响SI和MDD。
在logistic回归模型中引入PRS与风险评分的交互项,评估显著性。
评估社会联系和蛋白质组特征是否介导遗传风险与SI/MDD之间的关联。
使用结构方程模型构建潜在变量,进行中介效应检验。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 蛋白质组分析 | Olink Explore 3072平台 | Olink | -- |
| 基因分型 | UK BiLEVE Axiom芯片 | -- | -- |
| UK Biobank Axiom芯片 | -- | -- | |
| PRS计算 | PLINK2 | -- | -- |
| PRSice | -- | -- | |
| 数据插补 | R impute包 | -- | -- |
| 统计分析 | statsmodels | -- | -- |
| 机器学习建模 | LightGBM | -- | -- |
| scikit-learn | -- | -- | |
| 中介分析 | semopy | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 样本选择 | 参与者来自UK Biobank,排除撤回同意的377人,并基于MDD或对照标准筛选,最终样本量13,085,均无抑郁症和SI病史。 阅读提示:Methods: Study population |
| 表型定义 | SI基于Field ID 20479和29108('觉得生命不值得活')在2017和2023年评估;MDD基于CIDI诊断,排除自伤和自杀行为。 阅读提示:Methods: Definition of suicide ideation and depression |
| 基因型与PRS计算 | 基因QC标准:基因型缺失率>0.02、样本缺失率>0.02、杂合度异常、HWE检验P<1×10-10、MAF<0.001、亲缘系数>0.0442;PRS基于PGC GWAS,使用PRSice剪枝,阈值P≤1。 阅读提示:Methods: Genotyping and PRS calculation |
| 环境暴露测量 | 23个社会联系相关自报问卷题,涵盖功能、结构、质量模块;'退休时'(Field ID 29170)需重编码为0/1以反映2017年前后退休状态。 阅读提示:Methods: Assessment of social connection-related phenotypes and Supplementary Table S1 |
| 蛋白质组学数据预处理 | 排除缺失率>20%的蛋白质;使用KNN插补缺失值(impute.knn函数默认参数)。 阅读提示:Methods: Data preprocessing |
| 关联分析 | logistic回归调整年龄和性别,以及前10个遗传主成分;FDR校正α=0.05。 阅读提示:Methods: Statistical analysis |
| 机器学习模型 | 特征选择采用Wilcoxon秩和检验,取前K个特征(K=23用于社会特征;蛋白质特征K∈{3,5,10,50,100,300,500,800,1000,1500,2500,2911});模型训练采用十次五折交叉验证,在训练折内进行预处理和特征选择;最终每个模型选择最佳AUC。 阅读提示:Methods: Machine-learning classification models |
| 交互分析 | 交互项分别由社会联系风险评分和蛋白质组风险评分与PRS(SA-PRS, MDD-PRS)相乘;模型调整年龄、性别、前十遗传主成分。 阅读提示:Methods: Interaction modelling between risk scores and polygenic risk |
| 中介分析 | 结构方程模型采用semopy包;遗传风险潜在变量由MDD-PRS和SA-PRS组成;社会联系潜在变量由各模块最重要变量组成;蛋白质组潜在变量由每个结果的特征重要性前两名组成;评估直接和间接效应用10000次bootstrap。 阅读提示:Methods: Mediation analyses via structural equation modelling |