QA数据集构建与基因功能标注
为微调多模态模型提供涵盖确认、否认和开放式问题的功能关联问答数据
基于MANE Select release 1.4的蛋白质编码基因,使用GPT 4.1模型生成确认、否认和开放式QA样本,基因名、序列信息均未包含在QA样本中
Genolator enables protein function interpretation using a multimodal large language model fusing genomic and structural interpretation with natural language interaction
构建QA数据集微调多模态Llama,在保留测试集上进行二分类和开放式问答评估,并开展注意力与消融分析
MANE Select release 1.4 (GRCh38) 蛋白质编码基因的DNA与氨基酸序列 多模态Llama模型 (Evo2+ESM2/全微调) 多模态Llama模型 (Evo2+PST/全微调)
训练数据:约378,000个QA样本,涵盖确认、否认和开放式问题 模型架构:Llama-3 8B(Bio-Medical-Llama-3 8B)为基座,Evo2和PST/ESM2嵌入冻结 训练参数:最多10个epoch,batch size 8,学习率5e-5,早停patience=2 评估数据集:KMeans分割的保留测试集34,743个确认/否认问题 评估指标:Accuracy, Precision, Recall, F1-score, MCC
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
为微调多模态模型提供涵盖确认、否认和开放式问题的功能关联问答数据
基于MANE Select release 1.4的蛋白质编码基因,使用GPT 4.1模型生成确认、否认和开放式QA样本,基因名、序列信息均未包含在QA样本中
获取DNA序列、氨基酸序列和蛋白质结构的压缩表征,并映射到Llama token空间
使用Evo2 7B提取DNA嵌入(4096维),ESM2/ESMFold 3B提取氨基酸序列嵌入(2560维),PST提取结构富集氨基酸嵌入(1280维);通过独立虚拟token投影器将各模态映射到Llama隐藏层维度(4096),每个模态8个虚拟token
训练模型融合基因组嵌入与自然语言问答能力
基于Bio-Medical-Llama-3 8B,使用Unsloth和LoRA对token投影器和Llama模型进行联合微调,分别训练Evo2+ESM2和Evo2+PST两个变体
评估模型准确确认或否认蛋白质与GO术语关联的能力
在34,743个保留测试集问题上(确认n=15,463,否认n=14,943),将任务框架为二分类,比较全微调Genolator、消融版本、XGBoost和GPT 4.1的性能
评估最佳模型回答开放式基因功能问题的能力
仅评估全微调Genolator (Evo2+PST),使用GPT 4.1和GO Slim子集将模型生成答案与参考注释映射到简化GO术语集,评估重叠和匹配程度
探究模型是否有效整合自然语言和生物学信息
提取Llama最后隐藏层表征,通过t-SNE降维和成对余弦相似度分析,评估模型对GO术语的表征组织
评估多模态整合中不同模态的贡献
分析所有32层Llama的注意力权重,按token组(Evo2、ESM2/PST、prompt、output)计算均值和逐头注意力;通过将虚拟token替换为零向量进行消融,计算交叉熵损失增加
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| DNA序列嵌入提取 | Evo2 7B | -- | -- |
| 氨基酸序列嵌入提取 | ESMFold (3B) / ESM2 | Hugging Face | -- |
| 蛋白质结构富集序列嵌入提取 | 蛋白质结构transformer (PST) | -- | -- |
| 蛋白质结构数据获取 | AlphaFold蛋白质结构数据库 (PDB文件) | -- | -- |
| 模型微调 | Bio-Medical-Llama-3 8B | ContactDoctor | -- |
| Unsloth | -- | -- | |
| LoRA(低秩适应) | -- | -- | |
| 实验追踪 | Azure Machine Learning和MLflow | Microsoft | -- |
| QA数据集生成 | GPT 4.1(部署于Azure AI Foundry) | OpenAI / Microsoft | -- |
| LLM评估与监控 | Arize Phoenix | -- | -- |
| DNA序列获取 | BioPython | -- | -- |
| 模型推理硬件 | NVIDIA H100 GPU(Azure Standard_NC40ads_H100_v5) | NVIDIA | -- |
| NVIDIA A100 GPU(Azure Standard_NC24ads_A100_v4) | NVIDIA | -- | |
| 模型训练框架 | PyTorch | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| QA数据集构建 | 基因序列来源(MANE Select release 1.4 GRCh38)、GPT 4.1生成QA样本的系统提示和few-shot示例、每个基因每个GO方面的样本数量(3个确认+3个否认+1个开放式) 阅读提示:Methods中'Construction of custom QA datasets'小节及Additional file 2中'Prompts'表格 |
| 多模态嵌入提取 | Evo2嵌入提取层(blocks.28.mlp.l3)、ESM2嵌入维度(2560)、PST嵌入维度(1280)、超过1000氨基酸序列的分段策略 阅读提示:Methods中'Genomic sequence embeddings with Evo2'、'Protein sequence embeddings with ESM2'和'Structural enriched protein sequence embeddings with PST'小节 |
| 模型架构与微调 | 虚拟token数量(每模态8个)、LoRA应用的目标模块、训练超参数(batch size 8、学习率5e-5、最多10个epoch、早停patience=2) 阅读提示:Methods中'Multimodal projection into the Llama embedding space and Llama fine-tuning'和'Fine-tuning and experimental setup'小节 |
| 数据集分割 | KMeans聚类数(k=3)、训练/验证/测试比例(80%/10%/10%)、基于余弦相似度的聚类分配策略 阅读提示:Methods中'Similarity-aware dataset splitting'小节 |
| 模型评估 | 保留测试集大小(34,743个问题)、确认/否认问题数量(15,463/14,943)、评估指标定义 阅读提示:Methods中'Model evaluation'小节和Results中'Genolator can accurately confirm and deny gene functionality associations'部分 |