可解释蒸馏揭示深度学习剪接模型存在普遍的混淆因素和盲点

Interpretable distillation reveals that deep learning splicing models suffer from pervasive confounders and blind spots

作者信息Simon Liu, Wenjing Zhang, Oded Regev
PMID42625183
发布时间2026-08-21
DOI10.1186/s13059-026-04124-9

实验完整度

包含三个深度学习剪接模型、可解释蒸馏模型训练、多个实验数据集验证(Liao et al.、FAS、MFASS、MAPT)以及功能验证(ANCOVA、预测误差分析)等独立证据层级。

主要模型

SpliceAI深度学习剪接模型 Pangolin深度学习剪接模型 AlphaGenome基因组基础模型 可解释蒸馏模型

重点核对

模型版本:SpliceAI模型下载于2025年5月,Pangolin模型下载于2025年5月,AlphaGenome API访问于2025年11月 合成序列生成:随机70核苷酸可变区域,固定剪接位点,过滤隐剪接位点,约1M序列 蒸馏模型训练:卷积核数量、宽度、学习率等超参数通过150次贝叶斯优化调优,训练200轮 实验数据:Liao et al. 239,722条序列,FAS 7,918条序列(5,976条唯一),MFASS 16,469条序列,MAPT 47个变异体 校准方法:使用等渗回归在logit尺度上校准预测

摘要

背景 从基因组序列预测RNA剪接是理解基因调控和解读遗传变异的关键任务。近期深度学习的进展使得剪接预测算法相较于早期模型达到了最先进的性能。然而,由于深度学习模型的可解释性有限,当前剪接模型的预测机制仍知之甚少。 结果 在此,我们开发了一个使用可解释蒸馏来解释模型预测逻辑的框架。应用我们的框架,我们发现RNA剪接预测模型存在普遍的混淆因素和盲点,导致其在非参考序列上表现不佳。我们发现剪接模型通过序列基序的惊人简单的加性组合来识别外显子,包括已知的剪接调控元件。关键的是,我们的分析还揭示了剪接模型利用了与剪接无关的基因组混淆因素,并且未能充分捕捉RNA结构的影响,导致系统性的预测错误。 结论 我们的发现阐明了在基因组序列上训练模型的基本局限性,并提出了克服这些局限性的方法。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
深度学习剪接模型的预测逻辑是什么?它们是否可靠?存在哪些失败条件?
核心机制
剪接模型通过序列基序的加性组合来识别外显子,包括已知剪接调控元件,但它们过度依赖CpG富集和终止密码子缺失等基因组混淆特征,且未能充分学习RNA结构效应。
主要证据
可解释蒸馏模型与原始模型预测高度相关(Pearson r: 0.94-0.99);CpG和终止密码子与预测误差显著相关(ANCOVA p<5×10^-3和p<1×10^-20);模型对RNA结构变异不敏感,且对BLTP1等变异预测失败。
研究意义
本研究揭示了基因组深度学习模型的基本局限性,这些局限性可能超出剪接预测,影响其他基因调控预测任务,并为提高模型鲁棒性提供了方向,如引入随机序列库、多校准和结构信息。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

模型预测评估

评估深度学习剪接模型对实验测量的外显子包含水平(PSI)的预测准确性。

使用三个深度学习剪接模型(SpliceAI、Pangolin、AlphaGenome)对来自三个实验assay的序列进行预测,并通过等渗回归校准后与实验PSI比较,计算Pearson相关系数。

2

可解释蒸馏模型训练

训练可解释的蒸馏模型来复制深度学习模型的预测,从而揭示其预测逻辑。

使用随机序列生成合成训练数据(约1M序列),用每个深度学习模型评分作为标签,训练蒸馏模型(卷积层+神经基底层+求和层),并在保留集上验证其复现能力。

3

特征重要性分析

识别深度学习模型中影响预测的关键序列特征,并评估其生物学相关性。

通过检查蒸馏模型学习到的卷积滤波器(序列标志)和位置特异性贡献分数,排名特征重要性,并识别已知剪接调控元件和潜在新特征。

4

混淆因素验证

验证CpG和终止密码子是否作为混淆因素导致模型预测误差。

分析模型预测误差与CpG组成和终止密码子数量的关联,使用ANCOVA统计检验,并检查基因组上CpG岛内假阳性剪接位点预测和终止密码子外显子得分差异。

5

RNA结构盲点验证

评估深度学习剪接模型是否捕捉RNA结构效应。

分析模型预测误差与预测的最小自由能(MFE)和实验测得的结构稳定性分数的关联,并测试配对突变对预测方向的影响。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
SpliceAI----
Pangolin----
AlphaGenome----
RNAfoldViennaRNA--
VARNA--3-93
Logomaker----
fastp--v1.0.1
STAR--v2.7.11b
rMATS-turbo--v4.3.0
Illumina甲基化EPIC芯片Illumina--

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
模型预测
模型版本:SpliceAI(2025年5月下载)、Pangolin(2025年5月下载)、AlphaGenome(2025年11月API访问)
阅读提示:Methods: Splicing predictions (SpliceAI, Pangolin, AlphaGenome)
合成序列生成
序列设计:随机70核苷酸可变区,固定剪接位点,过滤隐剪接位点(MaxEntScan评分)
阅读提示:Methods: Synthetic training sequences
蒸馏模型训练
超参数:卷积核数量、宽度、学习率等(150次贝叶斯优化),训练轮次最多200
阅读提示:Methods: Interpretable distilled model architecture; Additional file 1: Table S1
实验数据集
数据集来源和数量:Liao et al. 239,722条;FAS 7,918条;MFASS 16,469条;MAPT 47个变异体
阅读提示:Methods: Experimental datasets
校准
校准方法:等渗回归(PAVA算法)在logit尺度上进行
阅读提示:Methods: Experimental datasets (Liao et al. Synthetic Exon Library)