面向药物分析的协同大语言模型

A collaborative large language model for drug analysis

作者信息Hongjian Zhou, Fenglin Liu, Jinge Wu, Wenjun Zhang, Guowei Huang, Lei Clifton, David Eyre, Haochen Luo, Fengyuan Liu, Kim Branson, Patrick Schwab, Xian Wu, Yefeng Zheng, Anshul Thakur, David A Clifton
PMID40987953
发布时间2026-05
DOI10.1038/s41551-025-01471-z

实验完整度

包含明确的模型构建、多种数据集上的性能评估以及人类评价和消融研究,但缺乏传统湿实验验证,主要依赖计算实验。

主要模型

DrugGPT模型 11个下游数据集

重点核对

基础LLM选择:InstructGPT (175B) 知识库:Drugs.com、NHS、PubMed 指令调优数据集:1000个样本,每数据集200个 超参数:K=5, τ=0.1, 学习率1×10^-3 训练轮数:20轮,批次大小32

摘要

大型语言模型(LLMs),如ChatGPT,在理解人类查询和生成具有人类水平流畅度的文本内容方面带来了巨大帮助。然而,在医疗保健应用中直接使用LLMs面临若干问题。LLMs容易产生幻觉,即看似合理且真实但事实错误的内容。理想情况下,生成内容的来源应便于临床医生评估。我们提出了一种基于知识的协同大语言模型DrugGPT,以做出准确、基于证据且忠实的建议,可用于临床决策。DrugGPT整合了多种临床标准知识库,并引入了一种协同机制,该机制在处理不同药物时自适应地分析查询、捕获相关知识点并使得这些查询与知识点对齐。我们在药物推荐、剂量推荐、不良反应识别、潜在药物间相互作用识别以及回答一般药理学问题上评估了所提出的DrugGPT。DrugGPT在各项指标上优于广泛的现有LLMs,并在所有指标上取得了最先进的性能,同时参数少于通用LLMs。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
如何利用协同大语言模型和临床标准知识库实现准确、基于证据且可追踪的药物分析,以辅助临床决策?
核心机制
协作机制:IA-LLM分析查询,KA-LLM从知识图谱(DSDG)提取知识,EG-LLM基于证据生成回答,并通过知识一致性和证据可追踪提示策略减少幻觉,提高可信度。
主要证据
在11个数据集(包括MedQA-USMLE、MedMCQA、MMLU-Medicine、ChatDoctor、ADE、Drug-Effects、DDI、PubMedQA以及新构建的DrugBank-QA、MIMIC-DrugQA和COVID-Moderna)上,DrugGPT在所有任务上取得了最先进性能,例如USMLE准确率88.2%,DDI准确率97.1%,并在人类评价中超过ChatGPT和GPT-4。
研究意义
为AI聊天机器人准确理解医学查询并提供基于证据和忠实的医学输出提供解决方案,且可推广到其他医学领域。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

知识图谱构建

构建疾病-症状-药物关系图(DSDG)以支持知识检索。

从Drugs.com、NHS和PubMed提取知识,构建包含疾病和药物节点的知识图谱,并使用MiniLM文本编码器获得节点嵌入,通过归一化余弦相似度确定边权重。

2

指令调优

微调KA-LLM以从知识图谱中准确提取相关证据。

使用基于知识的指令提示调优,在LLaMA-7B上进行,输入结合图嵌入、任务指令和用户查询,采用自回归语言建模损失训练20个epoch。

3

下游任务评估

评估DrugGPT在药物推荐、剂量推荐、不良反应识别、药物相互作用和药理问答上的性能。

在11个数据集上评估DrugGPT,与多个基线(如GPT-4、ChatGPT、Med-PaLM-2)比较,涵盖多项指标,并与人工专家比较。

4

鲁棒性和泛化分析

验证DrugGPT对不同知识库规模的鲁棒性以及对未见药物的泛化能力。

通过调整知识库大小(1%至100%)评估性能;构建DrugQA数据集,进行跨类/类型/作用机制的测试。

5

人类评价与案例分析

评估方法生成的临床信息在事实性、完整性、安全性和偏好上的表现,并展示推理过程。

邀请两名医学专家对100个出院指导生成样本进行盲评,并与ChatGPT和GPT-4比较;分析DrugGPT的推理过程。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
知识图谱构建
知识库来源(Drugs.com、NHS、PubMed),节点特征提取,边计算中的K值和温度τ
阅读提示:Methods: KA-LLM - DSDG
指令调优
基础模型(LLaMA-7B),soft prompt长度,训练数据来源和数量,学习率,批次大小,优化器参数,训练轮数
阅读提示:Methods: Experimental settings
模型评估
数据集名称和样本量,提示词设计,运行次数,评估指标定义
阅读提示:Results: Comparison results, Table 1
鲁棒性分析
知识库大小百分比,检索器设置(余弦相似度、top-k=3、chunk size=512)
阅读提示:Results: Robustness results, Fig. 4
泛化分析
DrugQA数据集划分标准,训练-测试分离方式
阅读提示:Results: Results on unseen drugs, Table 4
人类评价
评估样本来源(100个出院指导生成样本),评价指标定义,专家盲法设计
阅读提示:Results: Human evaluation results, Supplementary Table 1