基准数据集构建
获取多样化的原核基因组,包括高质量参考、不同分类和模拟问题基因组,以评估不同条件下的工具性能。
从GTDB 207.0获取代表性细菌和古菌基因组,并额外下载所有大肠杆菌菌株;从NCBI下载基因组,通过GTDB元数据获取质量指标;另外对32,914个基因组引入0.5%,1%,2%的随机核苷酸删除模拟移码效应,并单独提取3,137个细菌MAG进行分析。
Large-scale benchmarking of prokaryotic annotation tools across thousands of species
本研究包含全面的大规模基准测试,涵盖多个数据集和条件,并使用多种指标(如编码密度、RNA特征、GO术语)进行功能验证,同时包含比较分析和影响评估,符合“高”的标准。
24,393株大肠杆菌基因组 26,970种细菌代表性基因组 2,791个古菌基因组 3,137个细菌宏基因组组装基因组(MAGs)
数据库版本:Bakta DB v5.0, EggNOG-mapper DB 2022-11-22, PGAP DB 2023-02-07, Prokka内置DB 翻译表:Mycoplasmatota使用第4套翻译表。 E. coli基因组数:24,393个,平均完整度99.72%,污染度0.41% 细菌和古菌基因组数:30,107细菌和2,791古菌,完整性均值95.45%和85.57% 移码模拟:对32,914个基因组引入0.5%,1%,2%的核苷酸缺失
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
获取多样化的原核基因组,包括高质量参考、不同分类和模拟问题基因组,以评估不同条件下的工具性能。
从GTDB 207.0获取代表性细菌和古菌基因组,并额外下载所有大肠杆菌菌株;从NCBI下载基因组,通过GTDB元数据获取质量指标;另外对32,914个基因组引入0.5%,1%,2%的随机核苷酸删除模拟移码效应,并单独提取3,137个细菌MAG进行分析。
使用四种工具对基因组进行注释,获取编码基因、RNA和功能注释。
分别使用Prokka、Bakta、EggNOG-mapper和PGAP的默认参数(除特定翻译表调整)对每个基因组进行注释,生成GFF文件。
比较各工具在编码密度、RNA特征、GO注释等方面的性能。
从注释文件中计算编码密度(总、描述、未描述)、RNA特征(rRNA、tRNA、tmRNA)数量和GO术语覆盖度与富集度。
评估工具在不同分类、基因组完整性和来源上的性能差异。
比较E. coli菌株(高完整性、低变异性)与细菌/古菌代表基因组(跨物种),以及MAGs(低完整性、高变异)上的工具表现,并分析移码的影响。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 基因组注释 | Prokka | -- | -- |
| Bakta | -- | -- | |
| EggNOG-mapper | -- | -- | |
| PGAP | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 基因组数据获取 | GTDB 207.0版本;NCBI下载;质量指标包括CheckM完整性、污染度;E. coli菌株命名筛选;代表基因组的条件 阅读提示:Methods: Datasets; Data querying and extraction |
| 注释工具参数 | 各工具版本、数据库版本、命令参数;特别是EggNOG-mapper的GO证据限制;PGAP的taxonomy输入 阅读提示:Methods: Tools; Prokka/Bakta/EggNOG-mapper/PGAP部分 |
| 移码模拟 | 删除百分比(0.5%,1%,2%),随机删除方法,基因组数量 阅读提示:Methods: Frameshifts |
| 数据分析指标 | 编码密度计算公式、未描述特征定义、GO术语提取方法、RNA特征识别方法 阅读提示:Methods: Data analysis |