大语言模型是强大的电子健康记录编码器

Large language models are powerful electronic health record encoders

作者信息Stefan Hegselmann, Georg von Arnim, Tillmann Rheude, Noel Kronenberg, David Sontag, Gerhard Hindricks, Roland Eils, Benjamin Wild
PMID42410244
发布时间2026-07
DOI10.1038/s41746-026-02915-9

摘要

电子健康记录(EHRs)在临床预测方面具有巨大潜力,但其复杂性和异质性对传统机器学习方法构成了挑战。在无标签EHR数据上训练的领域特异性EHR基础模型显示出更高的预测准确性和泛化能力,但其发展受到数据访问受限和站点特定词汇表的制约。本研究通过将医疗代码替换为自然语言描述,将EHR数据转换为纯文本,使通用大语言模型(LLMs)能够为下游预测任务生成高维嵌入,而无需访问私有的医疗训练数据。基于LLM的嵌入在EHRSHOT基准测试的15个临床任务中,与专用EHR基础模型CLMBR-T-Base表现相当。在英国生物银行(UK Biobank)的外部验证中,基于LLM的模型在某些任务上显示出统计上显著的改进,这归因于其更高的词汇覆盖率和稍好的泛化能力。总体而言,本研究揭示了专用EHR模型的计算效率与基于LLM的嵌入的可移植性和数据独立性之间的权衡。

实验方法