墨西哥城的膳食模式与社会发展指数:一种机器学习方法

Dietary Patterns and the Social Development Index in Mexico City: A Machine-Learning Approach

作者信息Mireya Martínez-García, Guadalupe Gutiérrez-Esparza, María Del Carmen González Salazar, Luis M Amezcua-Guerra, Enrique Hernández-Lemus
PMID42797083
期刊Nutrients
发布时间2026-09-21
DOI10.3390/nu18183100

实验完整度

中

基于3439人队列,采用k-means聚类、监督机器学习与SHAP分析,属明确实验方法与验证,但无功能或机制验证。

主要模型

墨西哥城Tlalpan 2020队列3439名成人(基线横断面) SFFQ评估的膳食摄入数据 SDI分层的社区居住数据

重点核对

聚类数k=3由Elbow法与Silhouette评分确定,全局轮廓系数0.110、Davies–Bouldin指数2.45、Calinski–Harabasz评分352、BSS/TSS约17.0% 监督模型采用Random Forest与HistGradientBoosting,分层五折交叉验证、网格搜索、ADASYN处理类不平衡、平衡准确率为主指标 能量校正食物组密度(g/1000 kcal)经log转换与标准化后用于聚类,PCA仅用于可视化 SDI关联分析使用列联表与卡方检验,效应量用Cramér's V,分析样本n=3385 膳食数据采集于2014–2019年,能量摄入<500或≥5000 kcal/day者排除

摘要

背景:膳食构成反映个体与环境因素的相互作用,但其与社会经济-地域条件的关系在拉丁美洲大城市中仍未得到充分描述。方法:我们在墨西哥城队列的3439名成年人中识别了经验性膳食模式,并检验了其与社会发展指数(SDI)的关联,SDI是一种综合的区域层面社会经济-地域发展指标。采用k-means聚类分析能量校正后的食物组摄入量,并使用基于SHAP解释的监督机器学习模型来刻画模式归属。结果:沿一条主要以水果和蔬菜相对贡献为区分特征的连续膳食梯度,识别出三种膳食模式——新鲜型、混合型和精制型。SHAP分析显示,新鲜型模式主要以女性和年龄较大为特征,精制型模式以体力活动、心血管代谢标志物、男性和较低SDI值的贡献较大为特征,而混合型模式主要以心血管代谢变量、酒精摄入和耐用物品拥有量为区分特征。膳食模式归属与SDI分层显著相关(χ2=40.77,p<0.001),但效应量较小(Cramér's V = 0.078)。被归类为新鲜型模式的参与者比例从最低SDI分层的35.7%增加到最高分层的51.9%,而精制型模式从44.6%下降到34.0%。监督模型显示出有限的区分能力(平衡准确率约0.40),表明尽管多变量特征不同,各模式之间存在显著重叠。结论:这些发现表明,该城市人群的膳食变异更适合表示为连续谱,而非截然分开的膳食表型。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
在墨西哥城城市成人队列中,能否识别经验性膳食模式,并刻画其与个体特征及居住地社会发展指数(SDI)的关系?
核心机制
膳食模式归属由不同组合的人口学、生活方式、人体测量、心血管代谢和社会经济-地域变量共同刻画,而非由单一领域一致区分;膳食变异表现为以水果和蔬菜相对贡献为主的连续梯度。
主要证据
在3439名成人中通过k-means识别出新鲜型、混合型和精制型三种模式;监督模型平衡准确率约0.40表明区分有限;SHAP显示不同模式由不同变量组合预测;卡方检验显示膳食模式与SDI分层相关(χ2=40.77,p<0.001,Cramér's V=0.078)。
研究意义
研究表明将无监督聚类、监督机器学习和模型可解释性技术结合可对膳食行为提供比单纯模式识别更丰富的刻画,并可能促进复杂城市人群膳食行为的未来研究及更贴合情境的公共健康营养策略制定。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

膳食数据预处理与食物组聚合

将个体食物项聚合为食物组并去除总能量摄入影响,以获得可用于聚类的膳食构成变量。

将个体食物项按营养相似性聚合为食物组,以密度(g/1000 kcal)表示,使用Isolation Forest识别并去除极端观测,随后对能量校正变量进行log转换和标准化。

2

无监督识别膳食模式

从膳食摄入数据中识别经验性膳食模式,不依赖预设标签。

使用Elbow法和Silhouette评分选择最优聚类数,采用k-means聚类在标准化全特征空间中进行分类,PCA仅用于事后可视化,并计算多种内部聚类有效性指标。

3

监督分类模型刻画模式归属

评估非膳食特征在多大程度上能够区分膳食模式归属,并识别贡献最大的变量。

以膳食聚类归属为目标变量,使用Random Forest和HistGradientBoosting分类器,采用统一预处理流程、网格搜索超参数优化、分层五折交叉验证和ADASYN处理类不平衡。

4

SHAP模型可解释性分析

识别对每种膳食模式分类贡献最大的非膳食变量。

使用SHAP对HistGradientBoosting模型在三分类设置下计算解释值,基于预处理训练集中的800名真实参与者随机子样本,排除ADASYN合成样本,从预测概率推导类别特异性SHAP值。

5

膳食模式与SDI分层关联分析

评估膳食模式归属与居住地社会发展指数分层之间的关联。

使用列联表和卡方独立性检验评估膳食模式与SDI分层的关联,用Cramér's V量化效应量,并以堆叠条形图进行可视化。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
膳食数据采集与预处理
SFFQ含104个食物和饮料条目、一年回忆期、十级消费频率、标准化份量;能量摄入≤500或≥5000 kcal/day者排除;Isolation Forest污染比例1%;能量校正食物组密度(g/1000 kcal)log转换后标准化
阅读提示:见Methods第2.3.1节Dietary Intake与第2.4.1节Dietary Data Preprocessing
聚类分析与模型选择
最优聚类数k=3由Elbow法和Silhouette评分确定;k-means在标准化全特征空间进行;PCA仅事后可视化;全局Silhouette评分0.110、Davies–Bouldin指数2.45、Calinski–Harabasz评分352、BSS/TSS约17.0%
阅读提示:见Methods第2.4.2节Unsupervised Identification of Dietary Patterns与Results第3.1节
监督分类模型构建
预测变量四域分组及具体变量;膳食变量排除;数值中位数插补、分类最频繁值插补后独热编码;Random Forest与HistGradientBoosting;网格搜索;分层五折交叉验证;ADASYN仅用于训练折;平衡准确率为主指标
阅读提示:见Methods第2.4.3节Supervised Modeling of Dietary Pattern Membership与第2.4.4节Class Imbalance Handling and Model Comparison
SHAP可解释性分析
SHAP基于HistGradientBoosting三分类模型;随机子样本n=800真实参与者;排除ADASYN合成样本;类别特异性SHAP值来自预测概率
阅读提示:见Methods第2.4.5节Model Interpretability与Figure 6图注
SDI关联分析
SDI分层:极低、低、中、高;有SDI分层的参与者n=3385;列联表与卡方独立性检验;Cramér's V量化效应量;结果χ2=40.77,p<0.001,Cramér's V=0.078
阅读提示:见Methods第2.4.6节Association Between Dietary Patterns and Social Development Strata与Results第3.5节、Figure 7
研究设计与样本来源
Tlalpan 2020队列,20–50岁临床健康男女,居住墨西哥城;基线数据采集于2014–2019年;排除既往诊断高血压或糖尿病者;排除缺失基线数据者;最终分析样本n=3439
阅读提示:见Methods第2.1节Study Design and Population与Results第3节、Figure 2