跨物种数据获取与差异表达分析
获取人类和小鼠转录组数据并识别各数据集内的差异表达基因,为后续跨物种比较提供基础。
从GEO数据库获取15个人类死后脑数据集和9个AD相关小鼠模型数据集,每个数据集独立进行差异表达分析;RNA-seq使用DESeq2,微阵列或归一化矩阵使用limma;比较AD或AD模型样本与对照样本,应用Benjamini-Hochberg FDR校正。
A meta-refined human Alzheimer's disease-associated gene subset shows partial mouse-model pathway correspondence and limited cross-cohort machine-learning transportability
研究以公开转录组数据集和统计建模为核心,包括差异表达、通路富集、随机森林分类等分析,但无湿实验功能验证,属观察性生信研究。
人类死后脑组织转录组数据集 AD相关小鼠模型(APP/PS1、3xTg-AD、5xFAD、rTg4510) 人类iPSC星形胶质细胞和神经元(敏感性分析) 人类额叶脑单核RNA-seq(GSE222494)
人类样本脑区与对照组/AD样本数(如GSE261775:50对照、44 AD) 小鼠模型品系与样本量(如GSE270100:APP/PS1,5对照、5模型) 差异表达阈值:FDR校正后P值<0.05且|log2FC|>0.58 随机森林参数:500棵树、最大深度8、随机种子42、平衡类别权重、概率阈值0.5 批次效应(队列身份可解释21.1%方差,诊断仅1.9%)
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
获取人类和小鼠转录组数据并识别各数据集内的差异表达基因,为后续跨物种比较提供基础。
从GEO数据库获取15个人类死后脑数据集和9个AD相关小鼠模型数据集,每个数据集独立进行差异表达分析;RNA-seq使用DESeq2,微阵列或归一化矩阵使用limma;比较AD或AD模型样本与对照样本,应用Benjamini-Hochberg FDR校正。
基于跨队列效应量与一致性,从非重叠候选基因中精炼出可靠的人类AD相关基因亚群,并验证其统计稳健性。
对每个候选基因在各队列计算Cohen's d,并使用随机效应模型整合,依据meta分析支持、效应方向一致性、跨队列复发和异质性优先排序;随后进行留一数据集分析,并与1000个复发匹配对照比较异质性、方向一致性;在三个额外人类脑队列中验证方向性重复。
注释Refined107涉及的生物通路,并检验其通路是否在小鼠模型中得到支持,以评估跨物种对应程度。
用clusterProfiler进行功能注释,并结合AD相关标记和通路面板评估基因集重叠;独立通路水平上,预先定义在至少两个人类队列中显著且NES方向一致的通路,然后在四个可分析小鼠数据集中评估其支持情况(同向、反向、无显著支持、覆盖不足)。
评估Refined107是否在不同人类队列内编码疾病状态信息,以及该信号能否跨队列迁移。
基于Refined107特征,对各机器学习队列(GSE261775, GSE261050, GSE278723)用随机森林进行分层五折交叉验证获得OOF预测;接着在一个队列训练模型,测试于另一队列(六个方向)评估跨队列性能;标准化的均值和标准差仅从训练队列获取。
评估队列效应对可移植性的影响,并表征Refined107在不同脑细胞类型中的可检测性与富集情况。
基于common59基因进行主成分分析和PERMANOVA估计队列身份与诊断解释的方差比例;单核分析使用GSE222494数据,按供体和细胞类型聚合为伪bulk,计算每细胞类型覆盖度,并比较AD与对照供体模块分数;背景校正富集分析评估Refined107是否在考虑全基因检测背景后仍显著富集。
按研究目的归类文中使用的方法,便于定位所需技术。
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 人类数据集差异表达分析 | 脑区/组织类型(见Table 1)、对照和AD样本量、差异表达阈值(FDR<0.05, |log2FC|>0.58)、使用的软件(DESeq2或limma) 阅读提示:见Methods 2.2节及Table 1样本信息 |
| Refined107精炼 | meta精炼队列(GSE261775, GSE261050, GSE278723)的样本量和特征基因列表 阅读提示:见Methods 2.3节及Results 3.1节 |
| 通路水平人鼠比较 | 人类通路定义所用队列(GSE203206, GSE122063, GSE138260)、小鼠通路数据集(GSE270100, GSE269314, GSE254970, GSE125957)、通路显著性阈值 阅读提示:见Methods 2.4节及Results 3.2节 |
| 随机森林分类与可移植性 | 随机森林超参数(500棵树、最大深度8、随机种子42、类别权重、概率阈值),特征基因集(Refined107或common59),OOF折叠策略,标准化的学习方式(从训练队列获得均值标准差) 阅读提示:见Methods 2.5节及Results 3.3节 |
| 队列偏移分析 | 用于PCA和PERMANOVA的基因集(common59),队列身份和诊断的方差贡献 阅读提示:见Methods 2.6节及Results 3.3节 |
| 单核分析 | GSE222494样本的诊断标签、细胞类型注释、伪bulk聚合方式、模块评分方法及背景校正 阅读提示:见Methods 2.6节及Results 3.4节 |