一个经元精炼的人类阿尔茨海默病相关基因亚群与小鼠模型通路仅有部分对应且跨队列机器学习可移植性有限

A meta-refined human Alzheimer's disease-associated gene subset shows partial mouse-model pathway correspondence and limited cross-cohort machine-learning transportability

作者信息Linsong Chai, Yunshi Huang, Jinglei Ni, Shuang Zuo, Jia Huang, Bingbing Lin
PMID42706501
发布时间2026-09
DOI10.1002/alz.71804

实验完整度

研究以公开转录组数据集和统计建模为核心,包括差异表达、通路富集、随机森林分类等分析,但无湿实验功能验证,属观察性生信研究。

主要模型

人类死后脑组织转录组数据集 AD相关小鼠模型(APP/PS1、3xTg-AD、5xFAD、rTg4510) 人类iPSC星形胶质细胞和神经元(敏感性分析) 人类额叶脑单核RNA-seq(GSE222494)

重点核对

人类样本脑区与对照组/AD样本数(如GSE261775:50对照、44 AD) 小鼠模型品系与样本量(如GSE270100:APP/PS1,5对照、5模型) 差异表达阈值:FDR校正后P值<0.05且|log2FC|>0.58 随机森林参数:500棵树、最大深度8、随机种子42、平衡类别权重、概率阈值0.5 批次效应(队列身份可解释21.1%方差,诊断仅1.9%)

摘要

引言 常用的阿尔茨海默病(AD)小鼠模型被广泛使用,但其与人类AD的分子对应关系仍不确定。 方法 我们分析了15个人类死后脑数据集、4个人类非脑或体外敏感性数据集以及9个AD相关小鼠模型分子谱数据集;GSE222494被单独分析用于单核定位。Refined107,一个经元精炼的107个人类AD相关基因亚群,通过复发匹配对照抽样、独立通路水平比较、队列内折叠外(OOF)分类和有序跨队列可移植性进行评估。 结果 Refined107包含37个Tier 1和70个Tier 2基因,并显示出比复发匹配对照更好的统计一致性。功能注释涉及炎症、血脑屏障、代谢、神经元和发育程序。在636个复发的人类通路中,有226个在至少一个评估的小鼠模型家族中显示出同向支持,表明人鼠对应性部分且依赖于模型。选择后的队列内OOF曲线下面积(AUC)为0.833至0.980,而有序跨队列AUC为0.288至0.720。 讨论 Refined107代表一个统计一致、经元精炼的人类AD相关基因亚群,而非全面的疾病特征。人鼠通路对应性是部分且依赖于模型的,队列内分类未转化为稳健的跨队列可移植性。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
常用AD小鼠模型与人类AD在分子层面的对应程度如何,以及一个经元精炼的人类AD基因亚群是否具有跨队列稳定性与可移植性?
核心机制
文中未明确将特定基因与功能机制直接关联,但生物注释提示Refined107关联炎症/固有免疫、血脑屏障与黏附、代谢/脂质-维生素信号、突触/神经信号及发育重激活等程序,这些关联未建立因果性。
主要证据
基于15个人类脑转录组和9个小鼠模型数据集的荟萃分析,Refined107与复发匹配对照相比统计一致性更高(如中位I2=0%对58.3%,方向一致率100%对0%);通路水平上,636条复发人类通路中226条在至少一个小鼠模型家族中获得同向支持;队列内OOF AUC为0.833-0.980,但跨队列AUC仅0.288-0.720。
研究意义
作者提出Refined107可作为优先评估人类相关AD分子程序的资源,为在模型系统及更大规模多组学、空间和功能研究中进一步评估提供框架,但明确其不是可部署的诊断分类器。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

跨物种数据获取与差异表达分析

获取人类和小鼠转录组数据并识别各数据集内的差异表达基因,为后续跨物种比较提供基础。

从GEO数据库获取15个人类死后脑数据集和9个AD相关小鼠模型数据集,每个数据集独立进行差异表达分析;RNA-seq使用DESeq2,微阵列或归一化矩阵使用limma;比较AD或AD模型样本与对照样本,应用Benjamini-Hochberg FDR校正。

2

Refined107基因亚群的精炼与统计一致性评估

基于跨队列效应量与一致性,从非重叠候选基因中精炼出可靠的人类AD相关基因亚群,并验证其统计稳健性。

对每个候选基因在各队列计算Cohen's d,并使用随机效应模型整合,依据meta分析支持、效应方向一致性、跨队列复发和异质性优先排序;随后进行留一数据集分析,并与1000个复发匹配对照比较异质性、方向一致性;在三个额外人类脑队列中验证方向性重复。

3

功能注释与人类-小鼠通路水平比较

注释Refined107涉及的生物通路,并检验其通路是否在小鼠模型中得到支持,以评估跨物种对应程度。

用clusterProfiler进行功能注释,并结合AD相关标记和通路面板评估基因集重叠;独立通路水平上,预先定义在至少两个人类队列中显著且NES方向一致的通路,然后在四个可分析小鼠数据集中评估其支持情况(同向、反向、无显著支持、覆盖不足)。

4

队列内OOF分类与有序跨队列可移植性评估

评估Refined107是否在不同人类队列内编码疾病状态信息,以及该信号能否跨队列迁移。

基于Refined107特征,对各机器学习队列(GSE261775, GSE261050, GSE278723)用随机森林进行分层五折交叉验证获得OOF预测;接着在一个队列训练模型,测试于另一队列(六个方向)评估跨队列性能;标准化的均值和标准差仅从训练队列获取。

5

队列偏移与单核定位分析

评估队列效应对可移植性的影响,并表征Refined107在不同脑细胞类型中的可检测性与富集情况。

基于common59基因进行主成分分析和PERMANOVA估计队列身份与诊断解释的方差比例;单核分析使用GSE222494数据,按供体和细胞类型聚合为伪bulk,计算每细胞类型覆盖度,并比较AD与对照供体模块分数;背景校正富集分析评估Refined107是否在考虑全基因检测背景后仍显著富集。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
GEOquery----
biomaRt----
metafor----
pROC----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
人类数据集差异表达分析
脑区/组织类型(见Table 1)、对照和AD样本量、差异表达阈值(FDR<0.05, |log2FC|>0.58)、使用的软件(DESeq2或limma)
阅读提示:见Methods 2.2节及Table 1样本信息
Refined107精炼
meta精炼队列(GSE261775, GSE261050, GSE278723)的样本量和特征基因列表
阅读提示:见Methods 2.3节及Results 3.1节
通路水平人鼠比较
人类通路定义所用队列(GSE203206, GSE122063, GSE138260)、小鼠通路数据集(GSE270100, GSE269314, GSE254970, GSE125957)、通路显著性阈值
阅读提示:见Methods 2.4节及Results 3.2节
随机森林分类与可移植性
随机森林超参数(500棵树、最大深度8、随机种子42、类别权重、概率阈值),特征基因集(Refined107或common59),OOF折叠策略,标准化的学习方式(从训练队列获得均值标准差)
阅读提示:见Methods 2.5节及Results 3.3节
队列偏移分析
用于PCA和PERMANOVA的基因集(common59),队列身份和诊断的方差贡献
阅读提示:见Methods 2.6节及Results 3.3节
单核分析
GSE222494样本的诊断标签、细胞类型注释、伪bulk聚合方式、模块评分方法及背景校正
阅读提示:见Methods 2.6节及Results 3.4节