患者入组与队列建立
建立多中心DILI患者队列,用于评估LLM和肝病学家的预测性能
从三个医疗中心纳入住院DILI患者,根据入排标准筛选,分为内部队列(瑞金医院,N=840)和外部队列(其他两个中心,N=103)
Multicenter Evaluation of Large Language Models Versus Hepatologists for Prognostic Prediction in Drug-Induced Liver Injury
多中心队列(943例)比较LLM与肝病学家预测性能,含内部和外部验证,但无功能或机制验证实验。
内部队列:上海瑞金医院840例DILI患者 外部队列:其他两个医疗中心103例DILI患者
内部队列840例,外部队列103例,均为住院DILI患者 结局分类:6个月恢复/慢性化、12个月慢性化、总体死亡或肝移植 评估者:三名肝病学家(初级3年、中级8年、高级20年经验)独立评估概率 LLM评估:每个患者评估三次,取平均概率作为最终结果 预测性能指标:AUROC、准确性、敏感性、特异性、PPV、NPV
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
建立多中心DILI患者队列,用于评估LLM和肝病学家的预测性能
从三个医疗中心纳入住院DILI患者,根据入排标准筛选,分为内部队列(瑞金医院,N=840)和外部队列(其他两个中心,N=103)
收集基线临床数据并生成标准化病例摘要,用于公平比较
从电子病历收集人口学信息、合并症、临床症状和实验室参数,包括ALT、AST、ALP、GGT、TBIL、DBIL、ALB、PT、INR等。根据R值分类肝损伤模式:肝细胞型(R≥5)、混合型(2<R<5)、胆汁淤积型(R≤2)。生成匿名化问题文档。
定义主要和次要终点,用于评估预测性能
基于12个月随访,结局分为恢复、6个月慢性化、12个月慢性化、总体死亡(任何原因死亡或肝移植)
评估LLM和不同经验水平肝病学家预测DILI结局的概率
将匿名化问题文档提交给LLM(GPT-5.1、Gemini-2.5 Pro、DeepSeek-3.2)和肝病学家(初级、中级、高级),评估6个月慢性化和总体死亡概率。每个LLM对每个患者评估三次,取平均概率。记录评估时间。
评估多LLM规则(OR、AND、VOTE)增强预测稳定性和性能的效果
基于三个LLM预测结果应用三种规则:OR规则(任一LLM预测阳性则为阳性)、AND规则(所有LLM预测阳性则为阳性)、VOTE规则(至少两个LLM预测阳性则为阳性)。计算AUROC、准确性、敏感性、特异性、PPV、NPV,并进行内部和外部验证。
将LLM性能与现有预测模型(Hy's Law、nHy's Law、MELD评分)比较,并分析不同触发药物亚组
比较LLM与现有模型预测总体死亡的性能。根据触发药物(传统草药或常规药物)进行亚组分析。
评估评估者间一致性和跨队列性能稳定性
使用Fleiss' κ和Cohen's κ评估组内和组间一致性。比较各评估者在总队列、内部和外部队列中的AUROC、准确性、敏感性和特异性变异。
按研究目的归类文中使用的方法,便于定位所需技术。
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 患者入组与队列建立 | 入组时间范围:2015年11月至2025年3月;中心来源:三个医疗中心;RUCAM评分≥6;排除标准:其他明确病因肝损伤、随访期间使用有害药物 阅读提示:Methods 2.1 Patients和2.2 Inclusion and Exclusion Criteria;Figure 1患者入组流程图 |
| 结局定义 | 6个月慢性化定义:肝脏检测、组织学或影像学持续肝损伤超过6个月;12个月慢性化定义:持续肝损伤超过12个月;总体死亡定义:任何原因死亡或肝移植 阅读提示:Methods 2.3 Outcomes;引用文献24、25、26 |
| 数据收集与标准化 | 收集的实验室参数完整列表:ALT、AST、ALP、GGT、TBIL、DBIL、ALB等;R值计算公式:ALT/ALP比值(以DILI发病时正常上限计) 阅读提示:Methods 2.4 Data Collection;引用文献27 |
| LLM预测评估 | LLM版本:GPT-5.1、Gemini-2.5 Pro、DeepSeek-3.2;评估次数:每个患者三次,取平均概率;提示词设计:文中未明确说明具体提示词内容 阅读提示:Methods 2.5 Evaluators Predicting Chronicity and Overall Mortality;Figure 2B工作流程 |
| 肝病学家评估 | 肝病学家经验年限:高级20年、中级8年、初级3年;评估方式:独立审阅问题文档估计概率 阅读提示:Methods 2.5 Evaluators Predicting Chronicity and Overall Mortality |
| LLM-Rules应用 | OR规则定义:任一LLM预测阳性则为阳性;AND规则定义:所有LLM预测阳性则为阳性;VOTE规则定义:至少两个LLM预测阳性则为阳性 阅读提示:Methods 2.5 Evaluators Predicting Chronicity and Overall Mortality |
| 统计分析与性能评估 | 最佳分类阈值确定:Youden指数在总队列确定,应用于内部和外部队列;AUROC比较:DeLong检验;准确性、敏感性、特异性比较:McNemar检验;一致性分析:Fleiss' κ和Cohen's κ 阅读提示:Methods 2.6 Statistical Analysis;Table 2脚注 |