嵌入AI模型时,院前损伤严重程度估计(PHISE)与院内创伤评分相匹配

Prehospital Injury Severity Estimate (PHISE) matches in-hospital trauma scores when embedded in AI models

作者信息Manuel Sigle, Andreas Goldschmied, Meinrad Gawaz, Alexander Münch, Peter Rosenberger, preTransIT Investigator group, Robert Wunderlich, Sven Weisser, Andreas Gather, Alfred Grützner, Oliver Kamp, Christian Waydhas, Marcel Dudda, André Nohl, Nicolas Eibinger, Paul Puchwein, Saffet Özkaya, Christian Knop, Martin Breitkopf, Kai Oliver Jensen, Yannik Kalbas, Ferdinand C Wagner, Benjamin Erdle
PMID42562846
发布时间2026-08-07
DOI10.1038/s41746-026-03074-7

实验完整度

研究包含回顾性推导(NTDB®)与前瞻性外部验证(TraumaRegister DGU®)两个独立数据层级,并进行了相关性、校准、预测性能(AUC/AUPRC)及机器学习(XGBoost)整合验证,证据层级丰富。

主要模型

NTDB® 2019回顾性推导队列(397,864例创伤患者) NTDB® 2020次级分析队列 TraumaRegister DGU®外部验证队列(14,136例创伤患者)

重点核对

PHISE评分推导:AIS至PHISE映射逻辑、影像依赖分类(临床可评估/需影像/不确定) PHISE评分结构:8个身体区域(头、面/颈、胸、腹、骨盆、脊柱、上肢、下肢)和4级严重程度(0-3) 结局定义:院内死亡率、RBCC输血需求(NTDB®中4小时内输血;TR-DGU®中24小时内输血) 评分聚合规则:三个最严重区域评分的平方和(PHISE,最高27分)

摘要

创伤严重程度评分(如损伤严重程度评分ISS和新损伤严重程度评分NISS)广泛用于创伤基准测试、风险分层和结局预测,但依赖于院前环境中无法获得的诊断影像。我们开发并外部验证了院前损伤严重程度估计(PHISE),这是一个简单的、基于现场应用的评分,通过临床检查和损伤机制知识实施。PHISE是通过将AIS编码的损伤描述映射到八个PHISE身体区域和四个严重程度级别,从国家创伤数据库(NTDB®)回顾性推导的,使用大型语言模型辅助推理来识别影像需求和区分临床可评估的损伤。在NTDB®队列中,PHISE评分与ISS和NISS显示出强相关性和校准性,但预测结局(包括院内死亡率和输血需求)的性能较低。外部验证使用了跨国创伤登记处DGU®,该登记处报告了与PHISE兼容的简化院前损伤评分的真实世界数据。在此,PHISE在预测死亡率方面不如ISS/NISS,但在输血预测方面达到了相当的性能。当与院前可获得的患者变量一起嵌入机器学习模型时,与ISS/NISS的性能差距进一步缩小。PHISE为院前紧急护理中更早的AI辅助创伤分层提供了一个实用的、不依赖影像的解剖学组成部分。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
能否开发并验证一种仅基于临床检查和现场信息(无需影像)的简化解剖损伤严重程度评分(PHISE),使其在静态和AI模型整合中与ISS/NISS性能相匹配?
核心机制
PHISE通过将AIS编码的损伤描述映射至8个身体区域和4个等级(0-3),利用临床检查和损伤机制知识评估损伤,不依赖诊断影像。
主要证据
在NTDB®队列中,PHISE与ISS/NISS相关性和校准良好(Spearman ρ=0.61/0.79);外部验证队列中相关性较弱(ρ=0.44/0.42)。PHISE预测死亡率性能低于ISS/NISS(AUC 0.71 vs 0.83/0.82;外部验证0.63 vs 0.81/0.84),但在输血需求预测上接近(AUC 0.77 vs 0.83/0.81;外部验证0.76 vs 0.78/0.77)。
研究意义
PHISE提供了一种实用的、不依赖影像的解剖学损伤严重程度评分,可作为AI辅助的早期创伤分层工具,在院前急救中实现更早的结局预测,补充生理评估和临床判断。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

推导PHISE评分

开发一种基于临床检查和现场知识(无需影像)的简化解剖损伤严重程度评分方法。

使用NTDB® 2019数据,通过NLP和LLM(GPT-4o-mini)推断AIS编码损伤的影像依赖性和PHISE身体区域映射,并将AIS严重度(0-6)映射为PHISE等级(0-3)。

2

评估PHISE与ISS/NISS的相关性和校准

验证PHISE评分与黄金标准解剖评分(ISS/NISS)在推导队列中的一致性和校准性。

计算PHISE评分(三最重区域平方和)并与ISS/NISS进行Spearman相关分析和校准分析(1000患者分组)。

3

评估PHISE的结局预测性能

评估PHISE评分预测临床结局(院内死亡率、输血需求)的判别性能。

计算PHISE、ISS、NISS预测院内死亡率和RBCC输血需求的AUC和AUPRC。

4

外部验证PHISE性能

验证PHISE评分在独立的多国创伤登记处(TraumaRegister DGU®)中的泛化性能。

在TR-DGU®队列重复相关性和预测性能分析,比较PHISE与ISS/NISS。

5

整合PHISE进入机器学习模型

探索将PHISE与院前变量结合到机器学习模型中能否缩小与ISS/NISS的性能差距。

将PHISE、ISS或NISS分别嵌入XGBoost模型,预测死亡率和输血需求,并分析特征重要性。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
GPT-4o-miniOpenAI--
R----
Python----
scikit-learn----
XGBoost----
pROC----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
PHISE评分推导
AIS至PHISE映射规则、LLM提示词、影像依赖分类阈值
阅读提示:Methods: PHISE score derivation; Supplementary Fig. S1
相关性分析
Spearman相关系数计算方法、PHISE评分聚合规则(三区域平方和)
阅读提示:Methods: Statistical analysis; Results: Concordance and calibration with ISS/NISS
结局预测性能评估
结局定义(死亡率、RBCC输血)、AUC/AUPRC计算方法、置信区间计算
阅读提示:Methods: Outcomes; Statistical analysis; Results: Predictive performance
机器学习模型
数据分割比例、缺失值插补策略、特征缩放、模型超参数、交叉验证方案
阅读提示:Methods: Supervised machine learning; Results: Performance in Machine Learning models