利用机器学习多模型预测西尼罗病毒神经侵袭性疾病,识别重要的区域气候驱动因素

Multi-Model Prediction of West Nile Virus Neuroinvasive Disease With Machine Learning for Identification of Important Regional Climatic Drivers

作者信息Karen M Holcomb, J Erin Staples, Randall J Nett, Charles B Beard, Lyle R Petersen, Stanley G Benjamin, Benjamin W Green, Hunter Jones, Michael A Johansson
PMID38023388
期刊Geohealth
发布时间2023-11-17
DOI10.1029/2023GH000906

实验完整度

研究为回顾性预测建模分析,包含多种概率模型拟合、性能评估和变量重要性分析,但无体外或体内实验验证,且预测性能未显著优于历史基线模型,实验层级单一。

主要模型

美国本土(CONUS)九大气候区域内的六边形网格(200 km直径)

重点核对

预测年份:2015-2021年 历史WNND病例数据:2005年以来的年度病例数 气候异常:基于PRISM数据的月度和季节温度及降水标准化异常 人口数据:2010年人口普查的县级别数据,包括总人口、65岁以上人口和人口密度 土地覆盖:基于2011年NLCD数据,计算每六边形内城市、农作物和湿地的比例

摘要

西尼罗病毒(WNV)是美国本土蚊媒传染病的主要原因。历史发病率、环境因素和复杂生态学的空间异质性使得预测WNV传播的时空变化具有挑战性。机器学习为识别此类情况下的重要变量提供了有前景的工具。为了预测美国本土(2015-2021年)的年度WNV神经侵袭性疾病(WNND)病例,我们拟合了10个概率模型,其复杂度从朴素模型到机器学习算法不等,并构建了一个集成模型。我们在九个气候区域的六边形网格上进行了预测,并评估了每个模型的预测精度。利用机器学习模型(随机森林和神经网络),我们识别了预测因子(历史WNND病例、气候异常、人口统计和土地利用)在各区域间的相对重要性和排名变化。我们发现历史WNND病例和人口密度是最重要的因素之一,而温度和降水的异常通常重要性较低。虽然每个模型的相对性能因气候区域而异,但模型之间的差异幅度较小。除朴素模型外,所有模型相对于基线模型(每个六边形拟合的负二项模型)的性能差异均不显著。没有任何模型,包括集成模型或更复杂的机器学习模型,在六边形或区域层面优于基于历史病例数的模型;这些模型是良好的预测基准。需要进一步的工作来评估预测能力是否能够超越这些历史基线的水平。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
在美国本土不同气候区域,利用多模型框架预测西尼罗病毒神经侵袭性疾病(WNND)年度病例,并识别重要的区域预测因子。
核心机制
历史病例数和人口密度是预测WNND病例最重要的变量,而气候异常(温度和降水)的预测重要性相对较低。
主要证据
基于2015-2021年CONUS九大气候区域的六边形网格数据,拟合10种概率模型(包括朴素、负二项、自回归、随机森林和神经网络)并评估其预测性能;随机森林和神经网络模型的变量重要性分析显示历史病例数和人口密度排名最高。
研究意义
本研究发现基于历史病例数的简单模型可作为良好的预测基准,并为未来改进WNND预测提供方向,如使用更先进的机器学习架构和整合更精细数据。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

数据准备与网格构建

为预测模型创建统一的空间分析单元,并整合多源数据。

基于CONUS县边界创建等面积六边形网格(直径200 km),将县级别的WNND病例数、人口统计、气候和土地利用数据分配到各六边形。

2

模型拟合与预测

拟合多种概率模型,预测各六边形年度WNND病例数,并比较不同模型的表现。

在九大气候区域内,分别拟合10种模型:Always Absent、NB-hex、NB-region、NB-nation、AR(1)、AR(1)-Climate、RF-month、RF-season、NN-month、NN-season,以及中位数集成模型。每个预测年份(2015-2021)重新训练模型。

3

模型性能评估

评估各模型在不同气候区域的预测精度,并比较与基线的差异。

使用对数评分(logarithmic score)评估模型预测概率与观测值的一致性,并通过贝叶斯广义线性模型比较模型间的性能差异。

4

变量重要性分析

识别各气候区域内对WNND预测最重要的变量。

对于RF模型,计算排列重要性(permutation importance);对于NN模型,使用Olden方法汇总连接权重。分析历史病例数、气候异常、人口密度和土地利用变量在预测中的相对重要性及其随年份的变化。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
sf--1.0-8
tigris----
ArboNETCDC--
PRISMPRISM Climate Group & Oregon State University--
国家土地覆盖数据库U.S. Geological Survey--
rstanStan Development Team2.26.22
MASS----
forecast--8.19
forecastML--0.9.1
neuralnet--1.44.6
rstanarm--2.21.3
emmeans--1.8.5
NeuralNetTools--1.5.3

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据准备
六边形网格直径(200 km)、气候区域划分(九大区域)、数据源(ArboNET、PRISM、NLCD)
阅读提示:Materials and Methods, Section 2.1
模型拟合
模型类型(NB、AR、RF、NN)、超参数(RF:ntree、mtry;NN:隐藏层节点数、激活函数)、训练数据范围(预测年前所有年份)
阅读提示:Materials and Methods, Section 2.2
模型评估
对数评分计算方法、贝叶斯GLM设置(链数、迭代次数)、回归模型中的协变量
阅读提示:Materials and Methods, Section 2.3