人类专家与人工智能系统在儿科菜单评估中的领域依赖性表现

Domain-Dependent Performance of Human Experts and AI Systems in Pediatric Menu Evaluation

作者信息Roxana Maria Martin-Hadmaș, Rebeca Sovea, Diana Pol, George Mihăiță Gavra, Monica Tarcea, Adriana Neghirlă, Ștefan Adrian Martin
PMID42797089
期刊Nutrients
发布时间2026-09-21
DOI10.3390/nu18183106

实验完整度

低

观察性横断面研究,基于三个标准化病例vignette,无体内或体外机制验证,能量估计仅77次且不平衡,AI与人类评估者仅比较评分一致性

主要模型

三个健康儿科病例标准化评估vignette(7岁男、12岁女、3岁女) 84个AI平台-配置评估 116名营养专家 56名儿科专科医生与88名其他专科医生

重点核对

三个儿科病例的年龄、性别、体重、身高、BMI百分位、静息代谢率及选定的心血管代谢参数与详细食物日记(含食物重量、照片和供餐程序) 专家参考小组由三名临床营养专家、两名儿科医生和一名学校医学医生组成,通过多学科讨论达成一致共识,未计算评分者间一致性 AI评估采用42个AI平台在两种配置下共84次评估,使用标准化罗马尼亚语提示,部分平台以文本格式替代图像输入 人类评估者每组完成一次随机分配病例的结构化评估,包括定量评估、定性评估、全局分类和五项1–10评分 统计分析采用ANOVA或Kruskal–Wallis检验,事后比较使用Tukey或Dunn程序,FDR控制采用Benjamini、Krieger和Yekutieli两步线性逐步法

摘要

背景/目的:人工智能(AI)工具越来越多地用于膳食评估,但其在儿科营养中的可靠性仍不确定。本研究将AI系统与人类评估者在儿科菜单评估中的表现与专家定义的参考评分进行比较。方法:这项观察性横断面研究使用了来自三个健康儿科病例的匿名膳食和临床信息。一个由儿科营养专家组成的多学科小组建立了标准评估。评估由84次AI评估、116名营养专家、56名儿科专科医生和88名其他专科医生完成。结局包括总能量估计的绝对误差、份量和定性评分的偏差、标准化评分以及二元适宜性准确性。组间比较采用ANOVA或Kruskal–Wallis检验并进行事后分析。结果:共纳入344次评估。能量估计误差在各组间存在差异(Kruskal–Wallis = 12.85,p = 0.0016),但该分析基于一个有限且高度不平衡的77次评估子集。AI的平均绝对误差最大(260.3 ± 194.3 kcal),其次是营养专家(148.4 ± 81.5 kcal);其他专科医生的误差最低(60.4 ± 53.3 kcal);由于可用能量估计的数量少且不均衡,这些亚组比较应谨慎解读。AI的份量评分偏差(0.488;95% CI:0.38–0.60)大于营养专家(0.310;95% CI:0.20–0.42;p = 0.0019,q = 0.0059)和儿科专科医生(0.286;95% CI:0.16–0.41;p = 0.0181,q = 0.019)。相反,AI在多样性和加工水平上的偏差最低(分别为0.37 ± 0.49和0.33 ± 0.47),而人类组分别为1.15–1.36和1.22–1.57(均p = 0.0001)。结论:AI可能支持对描述性定性特征进行结构化儿科菜单筛查;然而,能量和份量评估的精密度较低支持在这些特定条件下将其作为辅助工具,供合格营养专业人员使用。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
AI系统与不同人类评估者组在儿科菜单评估中,相对于专家定义的参考评分,在能量、份量和定性维度上的准确性和领域依赖性表现如何?
核心机制
文中未明确说明
主要证据
基于三个健康儿科病例标准化vignette,比较84次AI评估与116名营养专家、56名儿科专科医生和88名其他专科医生评估。AI在多样性和加工水平偏差最低,但能量估计平均绝对误差最大(260.3 ± 194.3 kcal),份量评分偏差大于营养专家和儿科专科医生。
研究意义
AI可能支持结构化儿科菜单筛查的描述性定性特征;然而,能量和份量评估精度较低支持在这些特定条件下将其作为辅助工具,供合格营养专业人员使用,而非替代多学科临床专业知识。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

建立儿科病例标准化评估vignette与专家参考标准

为比较AI与人类评估者提供固定的标准化评估刺激和专家定义的参考评分

选取三个健康儿科病例(7岁男、12岁女、3岁女),包含年龄、性别、体重、身高、BMI百分位、静息代谢率、选定的心血管代谢参数及详细食物日记(含食物重量、照片和供餐程序)。由三名临床营养专家、两名儿科医生和一名学校医学医生组成的多学科参考小组通过直接讨论达成一致共识,建立病例特异性专家参考评分,包括总能量、份量、二元适宜性、多样性、加工水平、营养质量、颜色、吸引力、全局分类和1–10标准化评分。

2

采集人类评估者评估

获取不同专业背景人类评估者对儿科菜单的评估结果

人类评估者来自罗马尼亚,分为营养专家(n = 116)、儿科专科医生(n = 56)和其他专科医生(n = 88)。每位评估者完成一次随机分配病例的结构化营养评估报告,包括定量评估、定性评估、全局分类和五项标准化1–10评分(定量、定性、营养、吸引力、颜色)。评估者记录专业类别、居住地区、执业环境、专业经验年限、营养评估参与程度、膳食推荐参与程度和与注册营养师合作情况。

3

采集AI平台评估

获取多种AI平台配置对儿科菜单的评估结果

选择42个AI平台,每个平台在两种不同配置下评估(共84次AI评估),配置由访问类型(免费或付费)、模型或版本及/或相关运行模式或启用功能定义。每个AI评估接收与人类评估者相同的儿科病例信息和视觉/日记膳食数据,使用标准化罗马尼亚语提示,要求定量评估、定性评估、全局分类、五项1–10评分和自我报告的参与程度。对于不支持直接图像上传的平台,以最接近支持的文本格式提供病例信息。

4

计算偏差指标并比较组间差异

评估各组评估者相对于专家参考标准的偏差,并检验组间差异

对每个评估者-病例对计算三类偏差指标:能量估计绝对差(MAE_kcal)、份量和各定性维度评分绝对差(diff)、二元一致性(Acc_bin)。采用普通单因素ANOVA或Kruskal–Wallis检验比较组间差异,事后比较使用Tukey或Dunn程序,FDR控制采用Benjamini、Krieger和Yekutieli两步线性逐步法。探索性Spearman秩相关分析能量估计误差、评估者特征与偏差结局的关联。探索性多元线性回归分析人类评估者特征与偏差结局的关联。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
Microsoft ExcelMicrosoft Corporation--
GraphPad Prism 9LLC/Dotmatics--

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
儿科病例标准化评估vignette
病例数(三个健康儿科病例:7岁男、12岁女、3岁女)、纳入标准(无已知慢性疾病)、病例信息内容(年龄、性别、体重、身高、BMI百分位、静息代谢率、选定的心血管代谢参数及详细食物日记)
阅读提示:Methods 2.1 Pediatric Cases and Standard Evaluations
专家参考标准建立
专家小组组成(三名临床营养专家、两名儿科医生和一名学校医学医生)、共识方法(直接多学科讨论达成一致共识,未进行独立评分前评估,未计算评分者间一致性)、能量和营养素计算数据库(USDA FoodData Central)
阅读提示:Methods 2.1 Pediatric Cases and Standard Evaluations
人类评估者评估
评估者分组及样本量(营养专家n = 116,儿科专科医生n = 56,其他专科医生n = 88)、评估者特征记录项、评估工具结构(定量评估、定性评估、全局分类、五项1–10评分)、病例分配方式(随机选择,无法预看病例内容)、排除标准
阅读提示:Methods 2.2 Human Evaluators 和 2.4 Evaluation Instrument
AI平台评估
AI平台数量(42个)及配置(每平台两种,共84次评估)、配置定义(访问类型、模型/版本、运行模式)、标准化提示语言(罗马尼亚语)及内容要求、图像输入处理方式、网络浏览或插件默认设置
阅读提示:Methods 2.3 AI Evaluators and Prompt;Supplementary File S1
偏差指标计算与统计分析
偏差指标定义(MAE_kcal、diff、Acc_bin)、能量估计可用样本量(77次评估,组间不平衡)、二元一致性计算条件(至少完成两个二元项目)、统计检验方法及事后比较程序、FDR控制方法、显著性水平(α = 0.05)
阅读提示:Methods 2.4 Evaluation Instrument 和 2.5 Statistical Analysis