大型语言模型用于健康检查结果的解读
Large language models for interpretation of health checkup results
大型语言模型(LLMs)展现出强大的泛化能力,但其解释结构化医疗数据的能力仍未得到充分研究。本研究利用韩国国民健康保险服务提供的综合健康检查数据,评估了四种LLMs——Claude Sonnet 4、Gemini 2.5 Pro、GPT-4o和LLaMA 3.1-70B。测试了多种提示策略(少样本、基于角色、基于约束和思维链)。零样本准确率平均为0.69(SD 0.06),使用组合策略后提升至0.92(0.06),使用思维链后提升至0.95(0.07)。Claude Sonnet 4、Gemini 2.5 Pro和GPT-4o获得了最高的准确率(≥ 0.98),而LLaMA 3.1-70B表现出较低但可改进的性能。对10,000个案例的项目级分析表明,对于大多数生化指标,包括葡萄糖、胆固醇、甘油三酯和肝酶,准确率接近完美(0.99-1.00)。相比之下,血压的准确率较低(0.61-0.91),且随年龄增长而下降,这可能是因为需要整合收缩压和舒张压值的多类别阈值较为复杂。亚组分析揭示了模型特定的偏见:在体重指数(Claude Sonnet 4)以及尿蛋白、血清肌酐和γ-谷氨酰转移酶(LLaMA 3.1-70B)中观察到与性别相关的偏见;而在血压(Claude Sonnet 4、Gemini 2.5 Pro)以及低密度脂蛋白胆固醇和血红蛋白(LLaMA 3.1-70B)中识别出与年龄相关的偏见。总体而言,先进的提示策略显著提高了模型性能,顶级LLMs展示了强大的解释能力,但对于血压等具有复杂临床语义的变量仍需谨慎。