基因组上的突变易感性决定因素在人类组织间基本保持不变

Determinants of mutation susceptibility along the genome are largely invariant across human tissues

作者信息Corinna Lewis Schmalohr, Yashna Paul, Nina Bundschuh, Andreas Beyer
PMID42638110
发布时间2026-08-22
DOI10.1186/s13059-026-04245-1

实验完整度

涉及癌症及健康组织的突变数据、多种机器学习模型及交叉验证、多个基因组特征预测因子的整合、不同尺度下预测能力的系统评估。

主要模型

10个癌症组织的外显子组数据 8个癌症组织的全基因组数据 25个健康组织的外显子组和全基因组数据

重点核对

训练数据中排除多位点重复突变以减少阳性选择影响 使用五核苷酸序列背景匹配的阴性对照 采用染色体交叉验证避免空间自相关偏差 排除罕见变异(人群频率>1%)

摘要

背景:沿基因组积累体细胞突变的倾向各不相同,这严重影响体细胞嵌合、肿瘤进化以及体细胞突变在年龄相关疾病中的潜在作用。导致突变率变异的基因组因素已经确定,例如,与复制起点的距离、染色质结构和序列背景。然而,它们对于解释沿基因组以及组织之间突变率的变异相对重要性仍然难以捉摸。结果:在这里,我们提出了一种建模策略,该策略整合了不同尺度的146个基因组特征,以预测25个人类组织中沿基因组的点突变易感性。这些模型能忠实预测癌症和健康组织中人类基因组编码和非编码部分的突变率,甚至包括模型训练期间未使用的未知组织类型。我们的工作揭示了突变率对染色质结构和其他基因组特征的依赖性在组织间显著不变,指向构成突变过程的保守基本机制。局部突变率变异在几个碱基对的尺度上几乎完全由序列背景驱动,而大尺度变异由染色质特征、基因表达和GC含量主导。结论:我们的建模策略量化了基因组因素对突变易感性的相对贡献,预测了人类组织中任何基因组分辨率下的突变偏差,并为更好地理解肿瘤进化和年龄相关疾病提供了基础。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
基因组特征(如染色质结构和序列背景)对突变率变异的相对贡献,以及这些特征在不同组织间是否保守。
核心机制
突变率对基因组特征的依赖在组织间基本不变,暗示存在保守的潜在过程;小尺度突变率变异主要由序列背景驱动,而大尺度变异主要由染色质特征、基因表达和GC含量等驱动。
主要证据
在10个癌症组织的外显子组和8个癌症组织的全基因组上训练了随机森林模型,并成功预测了25个健康组织的突变率;模型在组织间互换时只有轻微性能下降,且对未知组织的预测优于随机。
研究意义
研究提供了量化不同基因组特征对突变易感性相对贡献的框架,有助于更好地理解肿瘤进化和年龄相关疾病。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

数据收集与处理

获取用于训练和验证模型的突变数据及基因组特征数据。

从Pan-Cancer Atlas获取10种癌症组织的体细胞突变数据,从PCAWG获取8种癌症组织的全基因组突变数据,从SomaMutDB获取25种健康组织的突变数据;收集146种基因组特征,包括GC含量、复制时间、组蛋白修饰、基因表达等。

2

模型训练与评估

建立基于基因组特征的机器学习模型,预测突变易感性,并评估模型性能。

使用随机森林(RF)、逻辑回归(GLM)和LASSO稳定选择(SL)三种方法训练模型,采用染色体交叉验证评估性能,并比较不同方法的AUC。

3

特征重要性与跨组织分析

确定哪些基因组特征对突变易感性预测最重要,并检验模型在不同组织间的适用性。

计算Gini重要性以评估特征贡献,并测试模型在跨组织应用时的性能(如用脑模型预测乳腺突变),以评估模型的泛化能力。

4

序列上下文模型与整合

评估序列上下文相对于其他基因组特征对预测突变易感性的贡献,并整合两者以提高预测能力。

构建仅基于五核苷酸序列背景的突变率预测模型,并与基于基因组特征的RF模型组合(相乘或结合几率),在不同基因组尺度(从1bp到1Mb)下比较预测性能。

5

验证于健康组织及未知组织

验证模型能否预测健康组织以及未参与训练的组织中的突变。

使用健康组织(SomaMutDB)的突变数据,测试组织特异模型和通用异组织模型的预测性能,包括训练中未出现过的组织。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
Ensembl----
liftOverUCSC Genome Browser--
SIFT----
bedtools----
rtracklayer----
ranger----
pROC----
UCSC基因组浏览器UCSC--
ZenodoZenodo--
GitHubGitHub--

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
突变数据过滤
SNV过滤条件:覆盖深度(正常组织≥8,肿瘤组织≥14),人群频率≤1%,排除多位点重复突变
阅读提示:Methods:数据收集(Exome cancer mutations、Whole genome cancer mutations、Healthy tissue somatic mutations)
训练数据平衡
阳性与阴性样本按五核苷酸序列背景匹配,确保每个pentamer数量相等
阅读提示:Methods:Balancing of training data mutations
交叉验证策略
染色体交叉验证(CWCV):留出一条染色体作为测试集,其余用于训练
阅读提示:Methods:Model training and evaluation
模型参数
随机森林参数:importance='permutation',probability=TRUE;GLM使用logit链接;LASSO稳定选择pithr=0.6,PCER=0.1
阅读提示:Methods:Random forest、Logistic regression、Lasso with stability selection
序列上下文预测
五核苷酸突变率计算方式:每个pentamer的突变计数除以基因组中该pentamer的总出现次数
阅读提示:Methods:Sequence context-based prediction
整合预测评估
bin大小设置(100bp、1kb、100kb、1Mb),Spearman等级相关,显著性检验
阅读提示:Methods:Binning of genomic regions