Genolator:利用融合基因组与结构解读及自然语言交互的多模态大语言模型实现蛋白质功能解读

Genolator enables protein function interpretation using a multimodal large language model fusing genomic and structural interpretation with natural language interaction

作者信息Martin Danner, Tanhim Islam, Matthias Begemann, Florian Kraft, Miriam Elbracht, Ingo Kurth, Jeremias Krause
PMID42750043
发布时间2026-09-16
DOI10.1186/s13059-026-04274-w

实验完整度

中

构建QA数据集微调多模态Llama,在保留测试集上进行二分类和开放式问答评估,并开展注意力与消融分析

主要模型

MANE Select release 1.4 (GRCh38) 蛋白质编码基因的DNA与氨基酸序列 多模态Llama模型 (Evo2+ESM2/全微调) 多模态Llama模型 (Evo2+PST/全微调)

重点核对

训练数据:约378,000个QA样本,涵盖确认、否认和开放式问题 模型架构:Llama-3 8B(Bio-Medical-Llama-3 8B)为基座,Evo2和PST/ESM2嵌入冻结 训练参数:最多10个epoch,batch size 8,学习率5e-5,早停patience=2 评估数据集:KMeans分割的保留测试集34,743个确认/否认问题 评估指标:Accuracy, Precision, Recall, F1-score, MCC

摘要

背景:解码遗传密码以揭示其基因组功能是一项艰巨任务,将极大推动对疾病机制的理解和靶向治疗的开发。尽管大语言模型(LLMs)已变革了多个领域的自然语言处理,但由于基因组数据的复杂性及人类基因组中尚未探索的区域,将复杂的DNA语言转化为人类可读形式仍具挑战性。当前的语言模型要么能够处理自然语言,要么能够处理基因组密码,融合两者的模型在很大程度上仍然缺乏。结果:我们在此提出Genolator,一种多模态大语言模型,它将DNA序列、氨基酸序列和蛋白质结构的嵌入与自然语言查询相整合。Genolator基于超过365,000个使用抽象化Gene-Ontology(GO)术语生成的问答对进行微调,能够有效回答关于蛋白质亚细胞定位、分子功能和生物学过程的查询。评估表明,其在确认或否认蛋白质功能关联方面具有高准确性,优于基线模型,如公开可用的全能型LLM(如GPT 4.1)以及整合了蛋白质结构transformer知识的较小领域特定模型。对Genolator隐藏状态的探索揭示了其学习表征在生物学和语言学上的合理组织。对底层语言模型注意力头的分析和消融研究为多模态方法的益处提供了证据。结论:Genolator通过实现与蛋白质数据的自然语言交互,增强了基因组信息的可及性,促进了生物学发现和临床研究。它代表了通过整合多模态LLM朝着弥合基因组密码与人类语言之间鸿沟迈出的一步。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
能否构建一个多模态大语言模型,融合DNA序列、氨基酸序列和蛋白质结构信息,通过自然语言交互准确解读蛋白质功能?
核心机制
Genolator通过虚拟token投影器将Evo2、ESM2和PST等模态编码器的嵌入映射到Llama的token嵌入空间,实现多模态特征融合,并基于GO术语问答对进行微调,从而具备整合基因组与自然语言信息回答功能查询的能力。
主要证据
在34,743个保留测试集问题上,全微调Genolator (Evo2+PST) 达到约0.98 F1-score和0.959 MCC,优于GPT 4.1 (MCC=0.179) 和XGBoost (MCC=0.913);t-SNE和余弦相似度分析显示隐藏状态形成与GO层级一致的聚类;消融实验表明PST token对性能贡献大于Evo2 token。
研究意义
Genolator通过自然语言交互增强了基因组信息的可及性,促进生物学发现和临床研究,为弥合基因组密码与人类语言之间鸿沟迈出一步。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

QA数据集构建与基因功能标注

为微调多模态模型提供涵盖确认、否认和开放式问题的功能关联问答数据

基于MANE Select release 1.4的蛋白质编码基因,使用GPT 4.1模型生成确认、否认和开放式QA样本,基因名、序列信息均未包含在QA样本中

2

多模态嵌入提取与投影

获取DNA序列、氨基酸序列和蛋白质结构的压缩表征,并映射到Llama token空间

使用Evo2 7B提取DNA嵌入(4096维),ESM2/ESMFold 3B提取氨基酸序列嵌入(2560维),PST提取结构富集氨基酸嵌入(1280维);通过独立虚拟token投影器将各模态映射到Llama隐藏层维度(4096),每个模态8个虚拟token

3

多模态Llama模型微调

训练模型融合基因组嵌入与自然语言问答能力

基于Bio-Medical-Llama-3 8B,使用Unsloth和LoRA对token投影器和Llama模型进行联合微调,分别训练Evo2+ESM2和Evo2+PST两个变体

4

确认/否认二分类任务评估

评估模型准确确认或否认蛋白质与GO术语关联的能力

在34,743个保留测试集问题上(确认n=15,463,否认n=14,943),将任务框架为二分类,比较全微调Genolator、消融版本、XGBoost和GPT 4.1的性能

5

开放式问答生成能力评估

评估最佳模型回答开放式基因功能问题的能力

仅评估全微调Genolator (Evo2+PST),使用GPT 4.1和GO Slim子集将模型生成答案与参考注释映射到简化GO术语集,评估重叠和匹配程度

6

隐藏状态表征分析

探究模型是否有效整合自然语言和生物学信息

提取Llama最后隐藏层表征,通过t-SNE降维和成对余弦相似度分析,评估模型对GO术语的表征组织

7

注意力权重与模态消融分析

评估多模态整合中不同模态的贡献

分析所有32层Llama的注意力权重,按token组(Evo2、ESM2/PST、prompt、output)计算均值和逐头注意力;通过将虚拟token替换为零向量进行消融,计算交叉熵损失增加

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
Evo2 7B----
ESMFold (3B) / ESM2Hugging Face--
蛋白质结构transformer (PST)----
AlphaFold蛋白质结构数据库 (PDB文件)----
Bio-Medical-Llama-3 8BContactDoctor--
Unsloth----
LoRA(低秩适应)----
Azure Machine Learning和MLflowMicrosoft--
GPT 4.1(部署于Azure AI Foundry)OpenAI / Microsoft--
Arize Phoenix----
BioPython----
NVIDIA H100 GPU(Azure Standard_NC40ads_H100_v5)NVIDIA--
NVIDIA A100 GPU(Azure Standard_NC24ads_A100_v4)NVIDIA--
PyTorch----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
QA数据集构建
基因序列来源(MANE Select release 1.4 GRCh38)、GPT 4.1生成QA样本的系统提示和few-shot示例、每个基因每个GO方面的样本数量(3个确认+3个否认+1个开放式)
阅读提示:Methods中'Construction of custom QA datasets'小节及Additional file 2中'Prompts'表格
多模态嵌入提取
Evo2嵌入提取层(blocks.28.mlp.l3)、ESM2嵌入维度(2560)、PST嵌入维度(1280)、超过1000氨基酸序列的分段策略
阅读提示:Methods中'Genomic sequence embeddings with Evo2'、'Protein sequence embeddings with ESM2'和'Structural enriched protein sequence embeddings with PST'小节
模型架构与微调
虚拟token数量(每模态8个)、LoRA应用的目标模块、训练超参数(batch size 8、学习率5e-5、最多10个epoch、早停patience=2)
阅读提示:Methods中'Multimodal projection into the Llama embedding space and Llama fine-tuning'和'Fine-tuning and experimental setup'小节
数据集分割
KMeans聚类数(k=3)、训练/验证/测试比例(80%/10%/10%)、基于余弦相似度的聚类分配策略
阅读提示:Methods中'Similarity-aware dataset splitting'小节
模型评估
保留测试集大小(34,743个问题)、确认/否认问题数量(15,463/14,943)、评估指标定义
阅读提示:Methods中'Model evaluation'小节和Results中'Genolator can accurately confirm and deny gene functionality associations'部分