探索海洋宏基因组中马拉色菌的存在和分布
评估海洋环境中马拉色菌序列的存在频率和相对丰度。
利用BigQuery搜索2018年2月前的SRA数据库,分析11510个海洋宏基因组数据集中Malassezia和Hominidae的命中数,并计算相关性。
Malassezia in environmental studies is derived from human inputs
研究包含对SRA数据的生物信息学分析(BigQuery检索、ITS搜索、宏基因组组装)及系统发育分析,并进行了相关性检验和距离分析,但缺乏体外或体内实验验证,主要依靠数据分析。
海洋宏基因组数据集 人类皮肤宏基因组数据集 真菌ITS扩增子数据集
分析数据集的来源和类型(SRA中的海洋宏基因组、人类皮肤宏基因组等) 马拉色菌与人类DNA序列的相关性(Pearson相关系数) 宏基因组组装中马拉色菌的基因组完整性(BUSCO值) 马拉色菌序列相对丰度随离岸距离的变化
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
评估海洋环境中马拉色菌序列的存在频率和相对丰度。
利用BigQuery搜索2018年2月前的SRA数据库,分析11510个海洋宏基因组数据集中Malassezia和Hominidae的命中数,并计算相关性。
尝试从海洋宏基因组数据中组装出马拉色菌的宏基因组组装基因组(MAG),以评估其是否具有独立生存能力。
使用四种方法(ITS和MAT基因搜索、PebbleScout、BigQuery)识别最富集的数据集,对38个数据集进行组装和分箱,并通过MAG-Explorer流程提取Malassezia基因组。
确定海洋宏基因组中Malassezia序列与已知物种的关系。
从组装出的Malassezia bin中预测基因,使用MAFFT进行比对,构建最大似然树,并使用MUMmer将contigs与已知Malassezia基因组比对。
检验马拉色菌丰度与离岸距离的关系,以判断是否受人类活动影响。
对每个样本计算距离最近岸线的距离,并使用ggplot2绘制世界地图,利用Pearson相关系数分析Malassezia丰度与距离的相关性。
按研究目的归类文中使用的方法,便于定位所需技术。
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据获取与筛选 | SRA数据库的可用性;数据集的选取标准(海洋宏基因组、环境类型等);检索日期 阅读提示:Materials and Methods 中“Leveraging indexed databases: BigQuery and PebbleScout”部分 |
| 序列搜索与比对 | ITS和MAT引物序列;比对参数(L 100 -T 32);数据库版本 阅读提示:Materials and Methods 中“Exploration of metagenomic data in marine environments”部分 |
| 宏基因组组装与分箱 | metaSPAdes版本和k-mer设置;分箱工具参数;BUSCO评估标准 阅读提示:Materials and Methods 中“Exploration of metagenomic data in marine environments”部分 |
| 系统发育分析 | 基因预测软件及训练集;比对和修剪工具及参数;建树模型和bootstrap值 阅读提示:Materials and Methods 中“Phylogenetic tree construction”部分 |
| 统计分析 | 相关性计算方法(Pearson);是否进行对数变换;显著性阈值 阅读提示:Materials and Methods 中“Leveraging indexed databases”部分及Results中相关描述 |