膳食数据预处理与食物组聚合
将个体食物项聚合为食物组并去除总能量摄入影响,以获得可用于聚类的膳食构成变量。
将个体食物项按营养相似性聚合为食物组,以密度(g/1000 kcal)表示,使用Isolation Forest识别并去除极端观测,随后对能量校正变量进行log转换和标准化。
Dietary Patterns and the Social Development Index in Mexico City: A Machine-Learning Approach
基于3439人队列,采用k-means聚类、监督机器学习与SHAP分析,属明确实验方法与验证,但无功能或机制验证。
墨西哥城Tlalpan 2020队列3439名成人(基线横断面) SFFQ评估的膳食摄入数据 SDI分层的社区居住数据
聚类数k=3由Elbow法与Silhouette评分确定,全局轮廓系数0.110、Davies–Bouldin指数2.45、Calinski–Harabasz评分352、BSS/TSS约17.0% 监督模型采用Random Forest与HistGradientBoosting,分层五折交叉验证、网格搜索、ADASYN处理类不平衡、平衡准确率为主指标 能量校正食物组密度(g/1000 kcal)经log转换与标准化后用于聚类,PCA仅用于可视化 SDI关联分析使用列联表与卡方检验,效应量用Cramér's V,分析样本n=3385 膳食数据采集于2014–2019年,能量摄入<500或≥5000 kcal/day者排除
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
将个体食物项聚合为食物组并去除总能量摄入影响,以获得可用于聚类的膳食构成变量。
将个体食物项按营养相似性聚合为食物组,以密度(g/1000 kcal)表示,使用Isolation Forest识别并去除极端观测,随后对能量校正变量进行log转换和标准化。
从膳食摄入数据中识别经验性膳食模式,不依赖预设标签。
使用Elbow法和Silhouette评分选择最优聚类数,采用k-means聚类在标准化全特征空间中进行分类,PCA仅用于事后可视化,并计算多种内部聚类有效性指标。
评估非膳食特征在多大程度上能够区分膳食模式归属,并识别贡献最大的变量。
以膳食聚类归属为目标变量,使用Random Forest和HistGradientBoosting分类器,采用统一预处理流程、网格搜索超参数优化、分层五折交叉验证和ADASYN处理类不平衡。
识别对每种膳食模式分类贡献最大的非膳食变量。
使用SHAP对HistGradientBoosting模型在三分类设置下计算解释值,基于预处理训练集中的800名真实参与者随机子样本,排除ADASYN合成样本,从预测概率推导类别特异性SHAP值。
评估膳食模式归属与居住地社会发展指数分层之间的关联。
使用列联表和卡方独立性检验评估膳食模式与SDI分层的关联,用Cramér's V量化效应量,并以堆叠条形图进行可视化。
按研究目的归类文中使用的方法,便于定位所需技术。
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 膳食数据采集与预处理 | SFFQ含104个食物和饮料条目、一年回忆期、十级消费频率、标准化份量;能量摄入≤500或≥5000 kcal/day者排除;Isolation Forest污染比例1%;能量校正食物组密度(g/1000 kcal)log转换后标准化 阅读提示:见Methods第2.3.1节Dietary Intake与第2.4.1节Dietary Data Preprocessing |
| 聚类分析与模型选择 | 最优聚类数k=3由Elbow法和Silhouette评分确定;k-means在标准化全特征空间进行;PCA仅事后可视化;全局Silhouette评分0.110、Davies–Bouldin指数2.45、Calinski–Harabasz评分352、BSS/TSS约17.0% 阅读提示:见Methods第2.4.2节Unsupervised Identification of Dietary Patterns与Results第3.1节 |
| 监督分类模型构建 | 预测变量四域分组及具体变量;膳食变量排除;数值中位数插补、分类最频繁值插补后独热编码;Random Forest与HistGradientBoosting;网格搜索;分层五折交叉验证;ADASYN仅用于训练折;平衡准确率为主指标 阅读提示:见Methods第2.4.3节Supervised Modeling of Dietary Pattern Membership与第2.4.4节Class Imbalance Handling and Model Comparison |
| SHAP可解释性分析 | SHAP基于HistGradientBoosting三分类模型;随机子样本n=800真实参与者;排除ADASYN合成样本;类别特异性SHAP值来自预测概率 阅读提示:见Methods第2.4.5节Model Interpretability与Figure 6图注 |
| SDI关联分析 | SDI分层:极低、低、中、高;有SDI分层的参与者n=3385;列联表与卡方独立性检验;Cramér's V量化效应量;结果χ2=40.77,p<0.001,Cramér's V=0.078 阅读提示:见Methods第2.4.6节Association Between Dietary Patterns and Social Development Strata与Results第3.5节、Figure 7 |
| 研究设计与样本来源 | Tlalpan 2020队列,20–50岁临床健康男女,居住墨西哥城;基线数据采集于2014–2019年;排除既往诊断高血压或糖尿病者;排除缺失基线数据者;最终分析样本n=3439 阅读提示:见Methods第2.1节Study Design and Population与Results第3节、Figure 2 |