大语言模型用于解读健康体检结果

Large language models for interpretation of health checkup results

作者信息Jiwon You, Hangsik Shin
PMID42486995
发布时间2026-07-22
DOI10.1038/s41746-026-02467-y

实验完整度

研究基于大规模真实健康体检数据(10,000例)进行多模型、多提示策略的准确性和可重复性评估,并包含亚组分析,但未涉及体外或动物等实验层级,属于算法性能评估。

主要模型

韩国国民健康保险服务体检队列(10,000例)

重点核对

四种大语言模型(Claude Sonnet 4、Gemini 2.5 Pro、GPT-4o、LLaMA 3.1-70B) 提示策略(零样本、角色、少样本、约束、思维链) 16项健康体检指标(BMI、血压、血糖等) 重复三次运行以评估可重复性 亚组分析(性别、年龄组)

摘要

大语言模型(LLMs)表现出强大的泛化能力,但其解读结构化医学数据的能力仍未得到充分研究。本研究使用韩国国民健康保险服务的综合健康体检数据,评估了四种大语言模型——Claude Sonnet 4、Gemini 2.5 Pro、GPT-4o和LLaMA 3.1-70B。测试了多种提示策略(少样本、基于角色、基于约束和思维链)。零样本准确率平均为0.69(标准差0.06),结合策略后提高到0.92(0.06),使用思维链后提高到0.95(0.07)。Claude Sonnet 4、Gemini 2.5 Pro和GPT-4o取得了最高准确率(≥0.98),而LLaMA 3.1-70B表现较低但可通过提示改进。对10,000个案例的项目级分析显示,大多数生化标志物(包括葡萄糖、胆固醇、甘油三酯和肝酶)的准确率接近完美(0.99–1.00)。相比之下,血压的准确率较低(0.61–0.91),且随年龄增长而下降,这可能是因为需要整合收缩压和舒张压的多类别阈值复杂性。亚组分析揭示了模型特定偏差:在体重指数(Claude Sonnet 4)和尿蛋白、血清肌酐、γ-谷氨酰转移酶(LLaMA 3.1-70B)中观察到性别相关偏差,而在血压(Claude Sonnet 4、Gemini 2.5 Pro)和低密度脂蛋白胆固醇、血红蛋白(LLaMA 3.1-70B)中识别出年龄相关偏差。总体而言,先进的提示策略显著提高了模型性能,顶级大语言模型展示了强大的解读能力,但对于血压等具有复杂临床语义的变量需要谨慎。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
大语言模型能否准确分类健康体检结果,以及提示设计和模型选择如何影响其性能?
核心机制
先进的提示策略(尤其是思维链)通过引导模型进行逐步推理,显著提升了分类准确性;模型性能差异受训练数据规模、强化学习方法和版本成熟度影响。
主要证据
基于10,000例韩国国民健康保险体检数据,评估四种LLM在五种提示策略下的分类准确率、可重复性和亚组差异,结果显示顶级模型准确率≥0.98,血压分类最易出错。
研究意义
本研究首次系统评估了LLM对结构化健康体检数据的解读能力,表明通过提示工程可实现高准确率,并指出需关注复杂项目(如血压)和人口统计学偏差,为未来将LLM作为辅助工具应用于医疗场景奠定基础。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

数据准备与标注

建立用于评估LLM分类性能的金标准数据集。

使用韩国NHIS健康体检数据,选择16项指标,去除缺失值后分层抽样10,000例,并依据KDCA或Mayo Clinic指南制定参考范围,生成多类别标签。

2

提示策略设计

测试不同提示方法对LLM分类性能的影响。

对每个模型应用五种提示策略:零样本、角色、少样本+角色、约束+少样本+角色、思维链+约束+少样本+角色。

3

性能评估与可重复性

量化各模型的分类性能及其稳定性。

在10,000例数据上,使用准确率、灵敏度、特异性和F1分数评估;每个模型在相同条件下运行三次,计算标准差和Cohen's κ。

4

亚组分析

检测模型在不同性别和年龄组中的性能差异,评估潜在偏差。

按性别(男/女)和年龄组(20–24、25–44、45–64、≥65岁)分层,比较各模型在各项指标上的准确率差异。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
基于Python的脚本----
Claude Sonnet 4Anthropic--
Gemini 2.5 ProGoogle--
GPT-4oOpenAI--
LLaMA 3.1-70BMeta--

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据准备
数据来源:韩国NHIS体检数据(2023年KNHANES);样本量:10,000例,分层抽样;缺失值处理:移除缺失行;指标:16项临床变量
阅读提示:Methods部分:Dataset
参考范围与标签标准
参考范围依据:韩国疾病控制与预防中心或Mayo Clinic指南;多类别标签(0-5);性别特异性参考范围(如Hb、γ-GTP)
阅读提示:Methods部分:Establishment of Reference Ranges and Labeling Criteria
提示策略
提示类型:零样本、角色、少样本(6类示例,每类6例)、约束(具体阈值)、思维链(步骤引导);提示语言:韩语;模型版本:Claude Sonnet 4 (2025-05-22)、Gemini 2.5 Pro (2025-06-17)、GPT-4o (2024-05-13)、LLaMA 3.1-70B (2024-07-23)
阅读提示:Methods部分:Zero-Shot Prompt 至 Chain-of-Thought Prompting
性能评估
评估指标:准确率、灵敏度、特异度、F1分数;重复次数:3次独立运行;计算平均准确率和标准差
阅读提示:Methods部分:Performance Evaluation 和 Reproducibility Test