使用BioPathNet增强生物医学知识图谱中的链路预测

Enhancing link prediction in biomedical knowledge graphs with BioPathNet

作者信息Emy Yue Hu, Svitlana Oleshko, Samuele Firmani, Hui Cheng, Zhaocheng Zhu, Maria Ulmer, Matthias Arnold, Maria Colomé-Tatché, Jian Tang, Sophie Xhonneux, Annalisa Marsico
PMID41559192
发布时间2026-08
DOI10.1038/s41551-025-01598-z

实验完整度

包含多个独立证据层级:四种不同生物医学KG上的链路预测任务(基因功能、药物重定位、合成致死、lncRNA靶标),并有消融研究、扰动实验、与基线的对比及可解释性案例分析(如ALL和AD)。

主要模型

KEGG基因-通路知识图谱(基因功能预测) PrimeKG知识图谱(药物-疾病适应症预测) SynLethDB合成致死性知识图谱 LncTarD 2.0 lncRNA-靶标调控图谱

重点核对

基因功能预测:训练/验证/测试划分比例为70/10/20,BRG使用Pathway Commons,去除少于10个注释的KEGG通路。 药物重定位:使用TxGNN的零样本数据划分(0.83/0.12/0.05),每个疾病区域分别训练,BRG为PrimeKG剩余边(约570万条),训练10个epoch,早停基于验证MRR。 合成致死性预测:SynLethDB数据按7:1:2分割,阈值设置为0.3(过滤低置信度边),inductive设置采用KR4SL的数据划分,最终SL分数由前向和反向表示的平均值计算。 lncRNA靶标预测:LncTarD 2.0数据,七种调控机制合并为六种,BRG仅使用Pathway Commons的PPI部分(约110万条边,7种关系类型),节点类型包括lncRNA、mRNA、microRNA、转录因子、蛋白质等。

摘要

理解生物医学网络中的复杂相互作用对于生物医学的进步至关重要,但传统的链路预测(LP)方法在捕捉这种复杂性方面存在局限。我们提出了BioPathNet,一个基于神经Bellman-Ford网络(NBFNet)的图神经网络框架,通过基于路径的推理来解决生物医学知识图谱中LP的基于传统表示学习方法的局限性。与节点嵌入框架不同,BioPathNet通过考虑路径上的所有关系来学习节点对之间的表示,提高了预测准确性和可解释性,并允许可视化有影响力的路径和生物学验证。BioPathNet利用背景调控图增强消息传递,并使用严格的负采样来提高精度和可扩展性。BioPathNet在包括基因功能注释、药物-疾病适应症、合成致死性和lncRNA-靶标相互作用预测等不同任务中优于或匹配现有方法。我们的研究确定了急性淋巴细胞白血病和阿尔茨海默病等疾病的潜在额外药物适应症,并得到了医学专家和临床试验的验证。此外,我们优先考虑推定的合成致死基因对和调控性lncRNA-靶标相互作用。BioPathNet的可解释性将使研究人员能够追踪预测路径并获得分子见解。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
如何利用路径表示学习在生物医学知识图谱中进行准确且可解释的链路预测?
核心机制
BioPathNet基于NBFNet框架,通过广义Bellman-Ford算法学习节点对之间的路径表示,并引入背景调控图(BRG)增强消息传递,以及节点类型感知的负采样(NTA)和结构感知负采样(SANS)来提高预测精度。
主要证据
在四个生物医学任务(基因功能预测、药物重定位、合成致死性、lncRNA靶标预测)上,MRR均优于随机,消融实验显示BRG和NTA显著提升性能,且与多个基线的比较显示BioPathNet在多数任务上表现最佳或相当。
研究意义
BioPathNet在生物医学KG上实现了最先进的性能,可解释性使其能够追踪预测路径,有助于生成生物学假设和加速生物医学发现。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

构建生物医学知识图谱和背景调控图

为链路预测任务准备数据,包括主要图谱(G1)和背景调控图(G2)以增强消息传递。

使用KEGG/ConsensusPathDB构建基因-通路图谱,Pathway Commons作为基因功能预测的BRG;使用PrimeKG构建药物-疾病图谱,其余边作为BRG;使用SynLethDB构建合成致死图谱,并包含BRG;使用LncTarD 2.0构建lncRNA-靶标图谱,BRG仅含PPI。

2

负采样策略设计

生成有效负样本,提高模型决策边界和生物合理性。

采用NTA(节点类型感知)负采样,仅从与正样本尾节点类型相同的节点中采样负样本;结合SANS(结构感知负采样)基于局部图密度采样。

3

模型训练与超参数优化

训练BioPathNet模型,并通过验证集MRR优化超参数。

使用负对数似然损失函数,优化对抗温度和每个正样本的负样本数量等超参数,采用早停策略。

4

链路预测评估

评估BioPathNet在四个生物医学任务上的预测性能。

在测试集上计算MRR、Hits@k(k=1,3,10)、AUPRC、F1等指标,并与基线方法比较。

5

消融实验

评估BRG、NTA和SANS等设计选择的影响。

分别去除或替换这些组件,比较性能变化。

6

鲁棒性分析

评估模型对BRG扰动的鲁棒性。

向BRG添加或删除随机边,去除高连接度节点,去除特定关系类型,观察MRR变化。

7

可解释性分析

验证预测路径的生物学合理性。

使用梯度方法识别对预测贡献最大的路径,进行全局节点类型分析和富集分析,并展示具体案例(如ALL、AD)。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
PrimeKG----
Pathway Commons----
SynLethDB----
LncTarD----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
基因功能预测
训练/验证/测试集划分(70/10/20),KEGG路径过滤标准(至少10个基因注释),BRG选择(Pathway Commons)和连接性
阅读提示:Methods 'Gene function prediction task'部分
药物重定位
数据划分比例(0.83/0.12/0.05),零样本疾病区域定义,训练epochs(10),早停标准,每正样本负样本数,BRG的使用
阅读提示:Methods 'Drug repurposing task'部分
合成致死性预测
数据划分比例(7:1:2),置信度阈值(0.3),inductive设置的数据划分,最终分数计算方式(前向和反向平均)
阅读提示:Methods 'SL prediction task'部分
lncRNA靶标预测
调控机制分类(七种合并为六种),BRG的选择(仅PPI),节点类型定义(lncRNA、mRNA等)
阅读提示:Methods 'LncRNA–target prediction task'部分