大型语言模型与肝病学家在药物性肝损伤预后预测中的多中心评估

Multicenter Evaluation of Large Language Models Versus Hepatologists for Prognostic Prediction in Drug-Induced Liver Injury

作者信息Haoshuang Fu, Yanan Du, Gangde Zhao, Yuelin Xiao, Shuying Song, Xinya Zang, Tianhui Zhou, Yan Zhuang, Ruidong Mo, Rongtao Lai, Qing Xie
PMID42757445
期刊Liver Int
发布时间2026-10
DOI10.1111/liv.70879

实验完整度

中

多中心队列(943例)比较LLM与肝病学家预测性能,含内部和外部验证,但无功能或机制验证实验。

主要模型

内部队列:上海瑞金医院840例DILI患者 外部队列:其他两个医疗中心103例DILI患者

重点核对

内部队列840例,外部队列103例,均为住院DILI患者 结局分类:6个月恢复/慢性化、12个月慢性化、总体死亡或肝移植 评估者:三名肝病学家(初级3年、中级8年、高级20年经验)独立评估概率 LLM评估:每个患者评估三次,取平均概率作为最终结果 预测性能指标:AUROC、准确性、敏感性、特异性、PPV、NPV

摘要

背景与目标:药物性肝损伤(DILI)可能进展为慢性化或死亡。大型语言模型(LLM)可能增强临床决策,但其在DILI中相对于医生的效用仍不清楚。因此,我们评估了它们在预测DILI结局方面的表现。方法:我们纳入了来自三个中心的943例DILI患者作为内部和外部队列。基于12个月随访,结局被分类为恢复、6/12个月慢性化和死亡。LLM(Gemini-2.5 Pro、GPT-5.1、DeepSeek-3.2)、肝病学家(初级、中级、高级)和模型(Hy's Law、nHy's Law、MELD评分)估计结局概率。应用LLM-Rules(VOTE、OR、AND)以增强稳定性。评估了模型性能。结果:对于6个月慢性化,高级肝病学家达到最高AUROC(0.61),准确率为70%。Gemini-2.5 Pro和GPT-5.1的AUROC分别为0.60和0.59,优于初级和中级肝病学家。Gemini-2.5 Pro与高级肝病学家的一致性最强(κ=0.43)。LLM均表现出低于肝病学家的准确性和特异性。在12个月慢性化中观察到类似结果。对于总体死亡率,高级肝病学家达到最高AUROC(0.87),准确率为83%。Gemini-2.5 Pro和GPT-5.1达到AUROC为0.86,优于初级肝病学家、Hy's Law和nHy's Law。GPT-5.1与高级肝病学家的一致性最强(κ=0.25)。LLM-Rules在预测各队列结局方面表现出稳定性。OR和AND规则分别提高了敏感性和特异性。结论:GPT-5.1和Gemini-2.5 Pro在DILI结局中的AUROC接近高级肝病学家,但准确性和特异性有限。LLM-Rules在各队列中表现出稳定性能,并提高了敏感性或特异性,支持多LLM方法作为临床医生监督的补充工具的潜力。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
大型语言模型在预测药物性肝损伤患者慢性化和总体死亡结局方面的性能如何,与不同经验水平的肝病学家相比如何?
核心机制
文中未明确说明
主要证据
多中心队列943例DILI患者,LLM(GPT-5.1、Gemini-2.5 Pro、DeepSeek-3.2)和肝病学家基于基线临床数据预测结局。GPT-5.1和Gemini-2.5 Pro在6个月慢性化中AUROC分别为0.59和0.60,接近高级肝病学家的0.61;在总体死亡中AUROC均为0.86,接近高级肝病学家的0.87。LLM-Rules(OR和AND)提高敏感性和特异性,并在各队列中表现稳定。
研究意义
LLM(特别是GPT-5.1和Gemini-2.5 Pro)可作为临床医生监督的补充工具,基于易获得的基线数据帮助识别高风险DILI患者,支持及时转诊和专科评估,尤其在初级保健或资源有限环境中。LLM不能替代医生,应保持临床医生主导的决策。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

患者入组与队列建立

建立多中心DILI患者队列,用于评估LLM和肝病学家的预测性能

从三个医疗中心纳入住院DILI患者,根据入排标准筛选,分为内部队列(瑞金医院,N=840)和外部队列(其他两个中心,N=103)

2

数据收集与标准化

收集基线临床数据并生成标准化病例摘要,用于公平比较

从电子病历收集人口学信息、合并症、临床症状和实验室参数,包括ALT、AST、ALP、GGT、TBIL、DBIL、ALB、PT、INR等。根据R值分类肝损伤模式:肝细胞型(R≥5)、混合型(2<R<5)、胆汁淤积型(R≤2)。生成匿名化问题文档。

3

结局定义与随访

定义主要和次要终点,用于评估预测性能

基于12个月随访,结局分为恢复、6个月慢性化、12个月慢性化、总体死亡(任何原因死亡或肝移植)

4

LLM和肝病学家预测评估

评估LLM和不同经验水平肝病学家预测DILI结局的概率

将匿名化问题文档提交给LLM(GPT-5.1、Gemini-2.5 Pro、DeepSeek-3.2)和肝病学家(初级、中级、高级),评估6个月慢性化和总体死亡概率。每个LLM对每个患者评估三次,取平均概率。记录评估时间。

5

LLM-Rules应用与性能评估

评估多LLM规则(OR、AND、VOTE)增强预测稳定性和性能的效果

基于三个LLM预测结果应用三种规则:OR规则(任一LLM预测阳性则为阳性)、AND规则(所有LLM预测阳性则为阳性)、VOTE规则(至少两个LLM预测阳性则为阳性)。计算AUROC、准确性、敏感性、特异性、PPV、NPV,并进行内部和外部验证。

6

与现有模型比较及亚组分析

将LLM性能与现有预测模型(Hy's Law、nHy's Law、MELD评分)比较,并分析不同触发药物亚组

比较LLM与现有模型预测总体死亡的性能。根据触发药物(传统草药或常规药物)进行亚组分析。

7

一致性和稳定性分析

评估评估者间一致性和跨队列性能稳定性

使用Fleiss' κ和Cohen's κ评估组内和组间一致性。比较各评估者在总队列、内部和外部队列中的AUROC、准确性、敏感性和特异性变异。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
患者入组与队列建立
入组时间范围:2015年11月至2025年3月;中心来源:三个医疗中心;RUCAM评分≥6;排除标准:其他明确病因肝损伤、随访期间使用有害药物
阅读提示:Methods 2.1 Patients和2.2 Inclusion and Exclusion Criteria;Figure 1患者入组流程图
结局定义
6个月慢性化定义:肝脏检测、组织学或影像学持续肝损伤超过6个月;12个月慢性化定义:持续肝损伤超过12个月;总体死亡定义:任何原因死亡或肝移植
阅读提示:Methods 2.3 Outcomes;引用文献24、25、26
数据收集与标准化
收集的实验室参数完整列表:ALT、AST、ALP、GGT、TBIL、DBIL、ALB等;R值计算公式:ALT/ALP比值(以DILI发病时正常上限计)
阅读提示:Methods 2.4 Data Collection;引用文献27
LLM预测评估
LLM版本:GPT-5.1、Gemini-2.5 Pro、DeepSeek-3.2;评估次数:每个患者三次,取平均概率;提示词设计:文中未明确说明具体提示词内容
阅读提示:Methods 2.5 Evaluators Predicting Chronicity and Overall Mortality;Figure 2B工作流程
肝病学家评估
肝病学家经验年限:高级20年、中级8年、初级3年;评估方式:独立审阅问题文档估计概率
阅读提示:Methods 2.5 Evaluators Predicting Chronicity and Overall Mortality
LLM-Rules应用
OR规则定义:任一LLM预测阳性则为阳性;AND规则定义:所有LLM预测阳性则为阳性;VOTE规则定义:至少两个LLM预测阳性则为阳性
阅读提示:Methods 2.5 Evaluators Predicting Chronicity and Overall Mortality
统计分析与性能评估
最佳分类阈值确定:Youden指数在总队列确定,应用于内部和外部队列;AUROC比较:DeLong检验;准确性、敏感性、特异性比较:McNemar检验;一致性分析:Fleiss' κ和Cohen's κ
阅读提示:Methods 2.6 Statistical Analysis;Table 2脚注