数据准备与网格构建
为预测模型创建统一的空间分析单元,并整合多源数据。
基于CONUS县边界创建等面积六边形网格(直径200 km),将县级别的WNND病例数、人口统计、气候和土地利用数据分配到各六边形。
Multi-Model Prediction of West Nile Virus Neuroinvasive Disease With Machine Learning for Identification of Important Regional Climatic Drivers
研究为回顾性预测建模分析,包含多种概率模型拟合、性能评估和变量重要性分析,但无体外或体内实验验证,且预测性能未显著优于历史基线模型,实验层级单一。
美国本土(CONUS)九大气候区域内的六边形网格(200 km直径)
预测年份:2015-2021年 历史WNND病例数据:2005年以来的年度病例数 气候异常:基于PRISM数据的月度和季节温度及降水标准化异常 人口数据:2010年人口普查的县级别数据,包括总人口、65岁以上人口和人口密度 土地覆盖:基于2011年NLCD数据,计算每六边形内城市、农作物和湿地的比例
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
为预测模型创建统一的空间分析单元,并整合多源数据。
基于CONUS县边界创建等面积六边形网格(直径200 km),将县级别的WNND病例数、人口统计、气候和土地利用数据分配到各六边形。
拟合多种概率模型,预测各六边形年度WNND病例数,并比较不同模型的表现。
在九大气候区域内,分别拟合10种模型:Always Absent、NB-hex、NB-region、NB-nation、AR(1)、AR(1)-Climate、RF-month、RF-season、NN-month、NN-season,以及中位数集成模型。每个预测年份(2015-2021)重新训练模型。
评估各模型在不同气候区域的预测精度,并比较与基线的差异。
使用对数评分(logarithmic score)评估模型预测概率与观测值的一致性,并通过贝叶斯广义线性模型比较模型间的性能差异。
识别各气候区域内对WNND预测最重要的变量。
对于RF模型,计算排列重要性(permutation importance);对于NN模型,使用Olden方法汇总连接权重。分析历史病例数、气候异常、人口密度和土地利用变量在预测中的相对重要性及其随年份的变化。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 数据网格构建 | sf | -- | 1.0-8 |
| tigris | -- | -- | |
| 案例数据 | ArboNET | CDC | -- |
| 气候数据 | PRISM | PRISM Climate Group & Oregon State University | -- |
| 土地利用数据 | 国家土地覆盖数据库 | U.S. Geological Survey | -- |
| 模型拟合 | rstan | Stan Development Team | 2.26.22 |
| MASS | -- | -- | |
| forecast | -- | 8.19 | |
| forecastML | -- | 0.9.1 | |
| neuralnet | -- | 1.44.6 | |
| 模型评估 | rstanarm | -- | 2.21.3 |
| emmeans | -- | 1.8.5 | |
| 变量重要性分析 | NeuralNetTools | -- | 1.5.3 |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据准备 | 六边形网格直径(200 km)、气候区域划分(九大区域)、数据源(ArboNET、PRISM、NLCD) 阅读提示:Materials and Methods, Section 2.1 |
| 模型拟合 | 模型类型(NB、AR、RF、NN)、超参数(RF:ntree、mtry;NN:隐藏层节点数、激活函数)、训练数据范围(预测年前所有年份) 阅读提示:Materials and Methods, Section 2.2 |
| 模型评估 | 对数评分计算方法、贝叶斯GLM设置(链数、迭代次数)、回归模型中的协变量 阅读提示:Materials and Methods, Section 2.3 |