跨数千物种的原核生物注释工具的大规模基准测试

Large-scale benchmarking of prokaryotic annotation tools across thousands of species

作者信息Mateusz Jundzill, Martin Hölzer, Serghei Mangul, Mike Marquet, Ralf Ehricht, Mara Lohde, Riccardo Spott, Oliwia Makarewicz, Mathias W Pletz, Christian Brandt
PMID42706541
发布时间2026-09-04
DOI10.1186/s13059-026-04262-0

实验完整度

本研究包含全面的大规模基准测试,涵盖多个数据集和条件,并使用多种指标(如编码密度、RNA特征、GO术语)进行功能验证,同时包含比较分析和影响评估,符合“高”的标准。

主要模型

24,393株大肠杆菌基因组 26,970种细菌代表性基因组 2,791个古菌基因组 3,137个细菌宏基因组组装基因组(MAGs)

重点核对

数据库版本:Bakta DB v5.0, EggNOG-mapper DB 2022-11-22, PGAP DB 2023-02-07, Prokka内置DB 翻译表:Mycoplasmatota使用第4套翻译表。 E. coli基因组数:24,393个,平均完整度99.72%,污染度0.41% 细菌和古菌基因组数:30,107细菌和2,791古菌,完整性均值95.45%和85.57% 移码模拟:对32,914个基因组引入0.5%,1%,2%的核苷酸缺失

摘要

背景:基因组注释是从原核生物测序数据中获取功能意义的重要步骤,然而缺乏指导工具选择的系统性评估。我们首次对四种著名的开源注释工具(Prokka、Bakta、EggNOG-mapper和PGAP)在156,033个多样化基因组上进行了大规模研究。其中包括用于基线性能的大肠杆菌菌株、数千种古菌和细菌基因组,以及移码和宏基因组组装的基因组。结果:Bakta在注释高质量细菌基因组方面表现出色,而PGAP在注释古菌基因组和具有挑战性的细菌组装体(包括宏基因组组装、片段化或受污染的样本)方面更胜一筹。对于基因本体注释,PGAP始终提供更广泛的术语覆盖范围,而EggNOG-mapper为每个特征提供更多的术语。结论:我们的研究结果强调了工具特定的优势,这对于根据基因组质量、分类学和来源(例如MAG)选择最佳解决方案至关重要。这项研究为用户提供了基于证据的指南,并为未来的工具开发提供了信息。补充信息:在线版本包含补充材料,可在 https://doi.org/10.1186/s13059-026-04262-0 获取。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
哪种原核生物基因组注释工具在不同基因组质量、分类和来源下表现最佳?
核心机制
不同工具采用不同的预测策略(如序列相似性 vs 直系同源),导致在编码密度、RNA检测和GO注释覆盖上存在差异;PGAP通过ORFfinder和ProSplign实现了对移码的鲁棒性。
主要证据
基于156,033个基因组的注释分析,比较编码密度、RNA特征和GO术语覆盖度,显示Bakta在细菌描述编码密度上领先,PGAP在总编码密度和困难基因组(如MAGs)上更稳定,且对移码具有鲁棒性。
研究意义
研究为选择注释工具提供了循证指南,强调了工具特定优势,并有助于未来工具的发展。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

基准数据集构建

获取多样化的原核基因组,包括高质量参考、不同分类和模拟问题基因组,以评估不同条件下的工具性能。

从GTDB 207.0获取代表性细菌和古菌基因组,并额外下载所有大肠杆菌菌株;从NCBI下载基因组,通过GTDB元数据获取质量指标;另外对32,914个基因组引入0.5%,1%,2%的随机核苷酸删除模拟移码效应,并单独提取3,137个细菌MAG进行分析。

2

基因组注释

使用四种工具对基因组进行注释,获取编码基因、RNA和功能注释。

分别使用Prokka、Bakta、EggNOG-mapper和PGAP的默认参数(除特定翻译表调整)对每个基因组进行注释,生成GFF文件。

3

注释质量评估

比较各工具在编码密度、RNA特征、GO注释等方面的性能。

从注释文件中计算编码密度(总、描述、未描述)、RNA特征(rRNA、tRNA、tmRNA)数量和GO术语覆盖度与富集度。

4

不同数据集上的性能比较

评估工具在不同分类、基因组完整性和来源上的性能差异。

比较E. coli菌株(高完整性、低变异性)与细菌/古菌代表基因组(跨物种),以及MAGs(低完整性、高变异)上的工具表现,并分析移码的影响。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
Prokka----
Bakta----
EggNOG-mapper----
PGAP----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
基因组数据获取
GTDB 207.0版本;NCBI下载;质量指标包括CheckM完整性、污染度;E. coli菌株命名筛选;代表基因组的条件
阅读提示:Methods: Datasets; Data querying and extraction
注释工具参数
各工具版本、数据库版本、命令参数;特别是EggNOG-mapper的GO证据限制;PGAP的taxonomy输入
阅读提示:Methods: Tools; Prokka/Bakta/EggNOG-mapper/PGAP部分
移码模拟
删除百分比(0.5%,1%,2%),随机删除方法,基因组数量
阅读提示:Methods: Frameshifts
数据分析指标
编码密度计算公式、未描述特征定义、GO术语提取方法、RNA特征识别方法
阅读提示:Methods: Data analysis