数据收集与处理
获取用于训练和验证模型的突变数据及基因组特征数据。
从Pan-Cancer Atlas获取10种癌症组织的体细胞突变数据,从PCAWG获取8种癌症组织的全基因组突变数据,从SomaMutDB获取25种健康组织的突变数据;收集146种基因组特征,包括GC含量、复制时间、组蛋白修饰、基因表达等。
Determinants of mutation susceptibility along the genome are largely invariant across human tissues
涉及癌症及健康组织的突变数据、多种机器学习模型及交叉验证、多个基因组特征预测因子的整合、不同尺度下预测能力的系统评估。
10个癌症组织的外显子组数据 8个癌症组织的全基因组数据 25个健康组织的外显子组和全基因组数据
训练数据中排除多位点重复突变以减少阳性选择影响 使用五核苷酸序列背景匹配的阴性对照 采用染色体交叉验证避免空间自相关偏差 排除罕见变异(人群频率>1%)
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
获取用于训练和验证模型的突变数据及基因组特征数据。
从Pan-Cancer Atlas获取10种癌症组织的体细胞突变数据,从PCAWG获取8种癌症组织的全基因组突变数据,从SomaMutDB获取25种健康组织的突变数据;收集146种基因组特征,包括GC含量、复制时间、组蛋白修饰、基因表达等。
建立基于基因组特征的机器学习模型,预测突变易感性,并评估模型性能。
使用随机森林(RF)、逻辑回归(GLM)和LASSO稳定选择(SL)三种方法训练模型,采用染色体交叉验证评估性能,并比较不同方法的AUC。
确定哪些基因组特征对突变易感性预测最重要,并检验模型在不同组织间的适用性。
计算Gini重要性以评估特征贡献,并测试模型在跨组织应用时的性能(如用脑模型预测乳腺突变),以评估模型的泛化能力。
评估序列上下文相对于其他基因组特征对预测突变易感性的贡献,并整合两者以提高预测能力。
构建仅基于五核苷酸序列背景的突变率预测模型,并与基于基因组特征的RF模型组合(相乘或结合几率),在不同基因组尺度(从1bp到1Mb)下比较预测性能。
验证模型能否预测健康组织以及未参与训练的组织中的突变。
使用健康组织(SomaMutDB)的突变数据,测试组织特异模型和通用异组织模型的预测性能,包括训练中未出现过的组织。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 基因注释 | Ensembl | -- | -- |
| 基因组坐标转换 | liftOver | UCSC Genome Browser | -- |
| 遗传变异效应预测 | SIFT | -- | -- |
| 功能注释 | bedtools | -- | -- |
| 基因组数据操作 | rtracklayer | -- | -- |
| 机器学习 | ranger | -- | -- |
| 统计检验 | pROC | -- | -- |
| 基因组可视化 | UCSC基因组浏览器 | UCSC | -- |
| 数据存储和共享 | Zenodo | Zenodo | -- |
| GitHub | GitHub | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 突变数据过滤 | SNV过滤条件:覆盖深度(正常组织≥8,肿瘤组织≥14),人群频率≤1%,排除多位点重复突变 阅读提示:Methods:数据收集(Exome cancer mutations、Whole genome cancer mutations、Healthy tissue somatic mutations) |
| 训练数据平衡 | 阳性与阴性样本按五核苷酸序列背景匹配,确保每个pentamer数量相等 阅读提示:Methods:Balancing of training data mutations |
| 交叉验证策略 | 染色体交叉验证(CWCV):留出一条染色体作为测试集,其余用于训练 阅读提示:Methods:Model training and evaluation |
| 模型参数 | 随机森林参数:importance='permutation',probability=TRUE;GLM使用logit链接;LASSO稳定选择pithr=0.6,PCER=0.1 阅读提示:Methods:Random forest、Logistic regression、Lasso with stability selection |
| 序列上下文预测 | 五核苷酸突变率计算方式:每个pentamer的突变计数除以基因组中该pentamer的总出现次数 阅读提示:Methods:Sequence context-based prediction |
| 整合预测评估 | bin大小设置(100bp、1kb、100kb、1Mb),Spearman等级相关,显著性检验 阅读提示:Methods:Binning of genomic regions |