从北美河流众包构建的功能微生物组目录

A functional microbiome catalogue crowdsourced from North American rivers

作者信息Mikayla A Borton, Bridget B McGivern, Kathryn R Willi, Ben J Woodcroft, Annika C Mosier, Derick M Singleton, Ted Bambakidis, Aaron Pelly, Rebecca A Daly, Filipe Liu, Andrew Freiburger, Janaka N Edirisinghe, José P Faria, Robert Danczak, Ikaia Leleiwi, Amy E Goldman, Michael J Wilkins, Ed K Hall, Christa Pennacchio, Simon Roux, Emiley A Eloe-Fadrosh, Stephen P Good, Matthew B Sullivan, Elisha M Wood-Charlson, Christopher S Miller, Matthew R V Ross, Christopher S Henry, Byron C Crump, James C Stegen, Kelly C Wrighton
PMID39567690
期刊Nature
发布时间2025-01
DOI10.1038/s41586-024-08240-z

实验完整度

包含166个样本的宏基因组和宏转录组测序、3825个MAGs的组装与注释、代谢性状预测、功能基因表达分析以及地理空间与统计关联分析,并验证了核心微生物类群的功能与表达。

主要模型

美国河流表层水微生物群落 2,093个去冗余的宏基因组组装基因组(MAGs)

重点核对

总共166个样本,采样点地理分布覆盖美国90%的流域 宏基因组和宏转录组测序深度平均为其他研究的三倍 MAGs的组装采用三种不同流程(MEGAHIT、IDBA-UD、metaSPAdes)并用CheckM评估质量 微生物功能性状注释基于DRAM和自定义规则集 统计关联分析使用PERMANOVA、Mantel检验和Pearson相关分析

摘要

预测元素循环并在日益增长的人为影响下维持水质,需要了解河流微生物组空间驱动因素的知识。然而,由于缺乏基因组解析的功能洞察以及跨多条河流的采样,对控制河流生物地球化学的核心微生物过程的理解受到阻碍。在这里,我们利用社区科学努力加速河流微生物组的采样、测序和基因组解析分析,以创建基因组解析开放流域数据库(GROWdb)。GROWdb 描述了覆盖美国90%流域的河流表层水中微生物基因组的身份、分布、功能和表达。具体来说,GROWdb 涵盖了来自27个门的微生物谱系,包括来自10个科和128个属的新成员,并在基因组水平上定义了核心河流微生物组。结合广泛的地理空间信息进行的 GROWdb 分析揭示了微生物群落构建的局部和区域驱动因素,同时提出了关于生态系统功能的基础性假设。基于先前提出的河流连续体概念,我们叠加了微生物功能性状表达,这表明河流微生物组的结构和功能是可预测的。我们通过多种协作网络基础设施公开提供 GROWdb,以便跨学科广泛访问,用于流域预测建模和基于微生物组的管理实践。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
河流表层水微生物群落的基因组组成、功能潜力和表达模式如何随地理和环境梯度变化?
核心机制
河流表层水微生物群落的组成和功能沿河流大小(Stream Order)梯度呈现可预测的变化,其核心类群主要依赖有氧呼吸和光驱动能量代谢。
主要证据
基于163个宏基因组和57个宏转录组分析,发现核心活跃属(如Planktophilia, Methylopumilus等)普遍编码有氧呼吸和光驱动代谢基因;碳利用相关基因表达随河流大小变化;生物地理统计揭示Stream Order是最强驱动因素。
研究意义
GROWdb提供了首个河流基因组资源,支持河流连续体概念在微生物群落功能层面的应用,为流域预测建模和水质管理提供了基础。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

样本采集与测序

获取覆盖美国主要流域的河流表层水微生物样本,并生成宏基因组和宏转录组数据。

通过WHONDRS和USGS NWQN众包方式采集166个样本,进行DNA/RNA共提取和测序(JGI和CU Anschutz),生成了约3.8 Tb数据。

2

宏基因组组装和基因组分箱

从测序数据中重建高质量的微生物基因组(MAGs)。

对每个样本进行三种组装流程(MEGAHIT、IDBA-UD、metaSPAdes)和分箱(metaBAT2),用CheckM评估质量,最终去冗余得到2,093个MAGs。

3

功能注释和代谢性状预测

注释MAGs的潜在功能,并预测微生物的能量代谢和碳利用等性状。

使用DRAM对MAGs进行功能注释,并基于自定义规则集(如呼吸链复合物I、电子受体等)对基因组进行分类(如好氧、厌氧、发酵等),并预测碳固定途径。

4

宏转录组分析与基因表达定量

评估河流微生物群落的基因表达活性,并识别核心活跃类群。

将宏转录组读段映射到MAGs,用featureCounts定量基因表达,计算geTMM标准化表达值,筛选在至少10%样本中表达的基因和MAGs。

5

新兴污染物基因谱分析

评估河流微生物组降解新兴污染物(如抗生素、微塑料)的遗传潜力及表达。

通过CARD数据库和RGI工具预测抗生素抗性基因,并通过DRAM注释其他污染物降解基因,统计其在宏基因组和宏转录组中的分布。

6

地理空间和环境关联分析

识别影响河流微生物群落组成和功能表达的环境驱动因素。

收集每个采样点的地理空间和地球化学数据(287个变量),使用Mantel检验、PERMANOVA和Pearson相关分析评估环境因素与微生物群落的关系。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
Sterivex过滤器EMD Millipore--
ZymoBIOMICS DNA/RNA提取试剂盒Zymo ResearchR2002
RNA清洁与浓缩-5试剂盒Zymo ResearchR1013
Nextera XT试剂盒Illumina--
Illumina NovaSeq测序仪Illumina--
Qiagen FastSelect探针组Qiagen--
TruSeq链特异性mRNA文库制备试剂盒Illumina--
KAPA Biosystems新一代测序文库qPCR试剂盒KAPA Biosystems--
Roche LightCycler 480荧光定量PCR仪Roche--

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
样本采集和过滤
采用无菌技术,使用0.22μm Sterivex过滤器,并通过注射器收集约1升表层水;过滤后添加3ml RNAlater储存。需确认是否所有样本都遵循相同流程。
阅读提示:Methods: Sample collection through crowdsourcing and standardization of workflows
核酸提取
WHONDRS样本使用ZymoBIOMICS DNA/RNA Miniprep kit和RNA Clean & Concentrator-5 kit进行DNA和RNA共提取;NWQN样本使用酚氯仿法提取DNA。提取后储存于-20°C。
阅读提示:Methods: Sample collection through crowdsourcing and standardization of workflows
测序文库构建和测序
宏基因组文库使用Nextera XT试剂盒,片段化后大小选择450-600bp,在Illumina NovaSeq 2x150上进行测序;宏转录组文库使用TruSeq Stranded mRNA kit,并使用KAPA qPCR kit定量。
阅读提示:Methods: Metagenomic assembly, binning and annotation & Metatranscriptomic mapping and analysis
宏基因组组装和分箱
采用三种组装流程(MEGAHIT、IDBA-UD、metaSPAdes)和binning(MetaBAT2),质量标准为完整性>50%,污染度<10%。去冗余基于99%平均核苷酸同一性。
阅读提示:Methods: Metagenomic assembly, binning and annotation
功能注释和代谢性状分类
MAGs使用DRAM注释,代谢性状基于自定义规则集(如呼吸链复合物I亚基>50%等)。
阅读提示:Methods: Microbial metabolism trait and carbon usage classification
宏转录组定量
进行rRNA去除后构建cDNA文库,使用Bowtie2比对到MAGs,过滤掉低于97%同一性的reads,使用featureCounts定量,并进行geTMM标准化。
阅读提示:Methods: Metatranscriptomic mapping and analysis
新兴污染物基因预测
使用RGI工具进行ARG预测,设置参数为'include loose',但仅保留'perfect'或'strict'命中结果。其他污染物基因基于DRAM注释。
阅读提示:Methods: Microbial metabolism trait and carbon usage classification
生物地理关联分析
需要每个采样点的配套地理空间数据(StreamCat等)和化学测量数据(如温度)。统计方法包括Mantel检验、PERMANOVA(999次置换)和Pearson相关分析。
阅读提示:Methods: Statistical analysis