数据准备与标注
建立用于评估LLM分类性能的金标准数据集。
使用韩国NHIS健康体检数据,选择16项指标,去除缺失值后分层抽样10,000例,并依据KDCA或Mayo Clinic指南制定参考范围,生成多类别标签。
Large language models for interpretation of health checkup results
研究基于大规模真实健康体检数据(10,000例)进行多模型、多提示策略的准确性和可重复性评估,并包含亚组分析,但未涉及体外或动物等实验层级,属于算法性能评估。
韩国国民健康保险服务体检队列(10,000例)
四种大语言模型(Claude Sonnet 4、Gemini 2.5 Pro、GPT-4o、LLaMA 3.1-70B) 提示策略(零样本、角色、少样本、约束、思维链) 16项健康体检指标(BMI、血压、血糖等) 重复三次运行以评估可重复性 亚组分析(性别、年龄组)
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
建立用于评估LLM分类性能的金标准数据集。
使用韩国NHIS健康体检数据,选择16项指标,去除缺失值后分层抽样10,000例,并依据KDCA或Mayo Clinic指南制定参考范围,生成多类别标签。
测试不同提示方法对LLM分类性能的影响。
对每个模型应用五种提示策略:零样本、角色、少样本+角色、约束+少样本+角色、思维链+约束+少样本+角色。
量化各模型的分类性能及其稳定性。
在10,000例数据上,使用准确率、灵敏度、特异性和F1分数评估;每个模型在相同条件下运行三次,计算标准差和Cohen's κ。
检测模型在不同性别和年龄组中的性能差异,评估潜在偏差。
按性别(男/女)和年龄组(20–24、25–44、45–64、≥65岁)分层,比较各模型在各项指标上的准确率差异。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 数据预处理 | 基于Python的脚本 | -- | -- |
| 大语言模型 | Claude Sonnet 4 | Anthropic | -- |
| Gemini 2.5 Pro | -- | ||
| GPT-4o | OpenAI | -- | |
| LLaMA 3.1-70B | Meta | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据准备 | 数据来源:韩国NHIS体检数据(2023年KNHANES);样本量:10,000例,分层抽样;缺失值处理:移除缺失行;指标:16项临床变量 阅读提示:Methods部分:Dataset |
| 参考范围与标签标准 | 参考范围依据:韩国疾病控制与预防中心或Mayo Clinic指南;多类别标签(0-5);性别特异性参考范围(如Hb、γ-GTP) 阅读提示:Methods部分:Establishment of Reference Ranges and Labeling Criteria |
| 提示策略 | 提示类型:零样本、角色、少样本(6类示例,每类6例)、约束(具体阈值)、思维链(步骤引导);提示语言:韩语;模型版本:Claude Sonnet 4 (2025-05-22)、Gemini 2.5 Pro (2025-06-17)、GPT-4o (2024-05-13)、LLaMA 3.1-70B (2024-07-23) 阅读提示:Methods部分:Zero-Shot Prompt 至 Chain-of-Thought Prompting |
| 性能评估 | 评估指标:准确率、灵敏度、特异度、F1分数;重复次数:3次独立运行;计算平均准确率和标准差 阅读提示:Methods部分:Performance Evaluation 和 Reproducibility Test |