模型预测评估
评估深度学习剪接模型对实验测量的外显子包含水平(PSI)的预测准确性。
使用三个深度学习剪接模型(SpliceAI、Pangolin、AlphaGenome)对来自三个实验assay的序列进行预测,并通过等渗回归校准后与实验PSI比较,计算Pearson相关系数。
Interpretable distillation reveals that deep learning splicing models suffer from pervasive confounders and blind spots
包含三个深度学习剪接模型、可解释蒸馏模型训练、多个实验数据集验证(Liao et al.、FAS、MFASS、MAPT)以及功能验证(ANCOVA、预测误差分析)等独立证据层级。
SpliceAI深度学习剪接模型 Pangolin深度学习剪接模型 AlphaGenome基因组基础模型 可解释蒸馏模型
模型版本:SpliceAI模型下载于2025年5月,Pangolin模型下载于2025年5月,AlphaGenome API访问于2025年11月 合成序列生成:随机70核苷酸可变区域,固定剪接位点,过滤隐剪接位点,约1M序列 蒸馏模型训练:卷积核数量、宽度、学习率等超参数通过150次贝叶斯优化调优,训练200轮 实验数据:Liao et al. 239,722条序列,FAS 7,918条序列(5,976条唯一),MFASS 16,469条序列,MAPT 47个变异体 校准方法:使用等渗回归在logit尺度上校准预测
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
评估深度学习剪接模型对实验测量的外显子包含水平(PSI)的预测准确性。
使用三个深度学习剪接模型(SpliceAI、Pangolin、AlphaGenome)对来自三个实验assay的序列进行预测,并通过等渗回归校准后与实验PSI比较,计算Pearson相关系数。
训练可解释的蒸馏模型来复制深度学习模型的预测,从而揭示其预测逻辑。
使用随机序列生成合成训练数据(约1M序列),用每个深度学习模型评分作为标签,训练蒸馏模型(卷积层+神经基底层+求和层),并在保留集上验证其复现能力。
识别深度学习模型中影响预测的关键序列特征,并评估其生物学相关性。
通过检查蒸馏模型学习到的卷积滤波器(序列标志)和位置特异性贡献分数,排名特征重要性,并识别已知剪接调控元件和潜在新特征。
验证CpG和终止密码子是否作为混淆因素导致模型预测误差。
分析模型预测误差与CpG组成和终止密码子数量的关联,使用ANCOVA统计检验,并检查基因组上CpG岛内假阳性剪接位点预测和终止密码子外显子得分差异。
评估深度学习剪接模型是否捕捉RNA结构效应。
分析模型预测误差与预测的最小自由能(MFE)和实验测得的结构稳定性分数的关联,并测试配对突变对预测方向的影响。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 模型预测 | SpliceAI | -- | -- |
| Pangolin | -- | -- | |
| AlphaGenome | -- | -- | |
| RNA结构预测 | RNAfold | ViennaRNA | -- |
| RNA结构绘图 | VARNA | -- | 3-93 |
| 序列标志可视化 | Logomaker | -- | -- |
| 数据处理 | fastp | -- | v1.0.1 |
| 序列比对 | STAR | -- | v2.7.11b |
| 剪接分析 | rMATS-turbo | -- | v4.3.0 |
| 甲基化分析 | Illumina甲基化EPIC芯片 | Illumina | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 模型预测 | 模型版本:SpliceAI(2025年5月下载)、Pangolin(2025年5月下载)、AlphaGenome(2025年11月API访问) 阅读提示:Methods: Splicing predictions (SpliceAI, Pangolin, AlphaGenome) |
| 合成序列生成 | 序列设计:随机70核苷酸可变区,固定剪接位点,过滤隐剪接位点(MaxEntScan评分) 阅读提示:Methods: Synthetic training sequences |
| 蒸馏模型训练 | 超参数:卷积核数量、宽度、学习率等(150次贝叶斯优化),训练轮次最多200 阅读提示:Methods: Interpretable distilled model architecture; Additional file 1: Table S1 |
| 实验数据集 | 数据集来源和数量:Liao et al. 239,722条;FAS 7,918条;MFASS 16,469条;MAPT 47个变异体 阅读提示:Methods: Experimental datasets |
| 校准 | 校准方法:等渗回归(PAVA算法)在logit尺度上进行 阅读提示:Methods: Experimental datasets (Liao et al. Synthetic Exon Library) |