环境研究中的马拉色菌源自人类输入

Malassezia in environmental studies is derived from human inputs

作者信息Saleh Rahimlou, Anthony S Amend, Timothy Y James
PMID40387408
期刊mBio
发布时间2025-06-11
DOI10.1128/mbio.01142-25

实验完整度

研究包含对SRA数据的生物信息学分析(BigQuery检索、ITS搜索、宏基因组组装)及系统发育分析,并进行了相关性检验和距离分析,但缺乏体外或体内实验验证,主要依靠数据分析。

主要模型

海洋宏基因组数据集 人类皮肤宏基因组数据集 真菌ITS扩增子数据集

重点核对

分析数据集的来源和类型(SRA中的海洋宏基因组、人类皮肤宏基因组等) 马拉色菌与人类DNA序列的相关性(Pearson相关系数) 宏基因组组装中马拉色菌的基因组完整性(BUSCO值) 马拉色菌序列相对丰度随离岸距离的变化

摘要

真菌马拉色菌是人类皮肤菌群中最普遍的成员,以其依赖脂质且无法合成长链脂肪酸而闻名。马拉色菌表现出显著的生态位广度,栖息于土壤、灰尘以及从极地到深海热泉的各种海洋环境中。马拉色菌在海洋栖息地(包括与海洋动物相关的栖息地)中的持续存在,表明该真菌能够在海洋生态系统中生长并发挥基本作用。在本研究中,我们探索了序列读取档案数据库中的宏基因组序列,以调查海洋生态系统中马拉色菌物种的存在、分布和起源,目标是组装马拉色菌基因组。使用各种搜索方法,我们发现所分析的鸟枪法和扩增子数据集中多达10%含有马拉色菌序列。然而,每个数据集中马拉色菌的相对丰度较低,并且海洋环境中人类与马拉色菌序列之间存在强相关性,这与污染一致。从最富含马拉色菌的数据集中,我们尝试生成宏基因组组装基因组。然而,马拉色菌重叠群共同显示出较低的基因组完整性水平,在样本中最高为2.2%。系统发育分析将这些重叠群鉴定为与人类相关的马拉色菌(Malassezia globosa)和限制马拉色菌(Malassezia restricta)密切相关,以及马拉色菌(Malassezia sympodialis)和厚皮马拉色菌(Malassezia pachydermatis),它们是所有研究环境中最常见的物种。我们的数据表明,环境中许多马拉色菌的观察结果源自人类来源,并且广泛的污染混淆了对海洋环境中马拉色菌多样性和生态作用的探索。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
海洋环境中的马拉色菌序列是否源于人类污染,而非本土海洋微生物群落的组成部分?
核心机制
马拉色菌序列与人类DNA序列在海洋宏基因组数据中显著相关,表明其广泛共引入,可能源于人类皮肤脱落或实验室污染。
主要证据
在11510个海洋宏基因组数据集中,20.5%含有马拉色菌序列,其中98.3%同时含有Hominidae序列;人类与马拉色菌序列之间存在显著正相关(Pearson r=0.72);从最富集的数据集中组装出的马拉色菌基因组完整性极低(最高2.2%),且与人类相关菌株M. globosa和M. restricta亲缘关系最近。
研究意义
研究提示广泛的人类污染可能混淆海洋环境中马拉色菌多样性和生态作用的探索,强调了在低生物量环境微生物组研究中需要严格控制污染。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

探索海洋宏基因组中马拉色菌的存在和分布

评估海洋环境中马拉色菌序列的存在频率和相对丰度。

利用BigQuery搜索2018年2月前的SRA数据库,分析11510个海洋宏基因组数据集中Malassezia和Hominidae的命中数,并计算相关性。

2

筛选高丰度马拉色菌的数据集并尝试组装基因组

尝试从海洋宏基因组数据中组装出马拉色菌的宏基因组组装基因组(MAG),以评估其是否具有独立生存能力。

使用四种方法(ITS和MAT基因搜索、PebbleScout、BigQuery)识别最富集的数据集,对38个数据集进行组装和分箱,并通过MAG-Explorer流程提取Malassezia基因组。

3

系统发育分析和基因组比对

确定海洋宏基因组中Malassezia序列与已知物种的关系。

从组装出的Malassezia bin中预测基因,使用MAFFT进行比对,构建最大似然树,并使用MUMmer将contigs与已知Malassezia基因组比对。

4

评估人类污染与离岸距离的相关性

检验马拉色菌丰度与离岸距离的关系,以判断是否受人类活动影响。

对每个样本计算距离最近岸线的距离,并使用ggplot2绘制世界地图,利用Pearson相关系数分析Malassezia丰度与距离的相关性。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
BigQueryGoogle Cloud Platform--
PebbleScoutNCBI--
序列读取档案NCBI--
metaSPAdes----
Metabat2----
Maxbin2----
Concoct----
DASTool----
MetaWrap----
CAT/BAT----
Kaiju----
BUSCO----
Augustus----
MAFFT----
TrimAl----
IQtree----
MUMmer----
R----
ggplot2----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据获取与筛选
SRA数据库的可用性;数据集的选取标准(海洋宏基因组、环境类型等);检索日期
阅读提示:Materials and Methods 中“Leveraging indexed databases: BigQuery and PebbleScout”部分
序列搜索与比对
ITS和MAT引物序列;比对参数(L 100 -T 32);数据库版本
阅读提示:Materials and Methods 中“Exploration of metagenomic data in marine environments”部分
宏基因组组装与分箱
metaSPAdes版本和k-mer设置;分箱工具参数;BUSCO评估标准
阅读提示:Materials and Methods 中“Exploration of metagenomic data in marine environments”部分
系统发育分析
基因预测软件及训练集;比对和修剪工具及参数;建树模型和bootstrap值
阅读提示:Materials and Methods 中“Phylogenetic tree construction”部分
统计分析
相关性计算方法(Pearson);是否进行对数变换;显著性阈值
阅读提示:Materials and Methods 中“Leveraging indexed databases”部分及Results中相关描述