LECA蛋白质组重建
重建LECA的蛋白质组,以识别可能存在于祖先中的基因家族。
构建了三个100蛋白质组数据集(eTOLDB),聚类为直系同源群(OG),根据物种分布定义LECA-OG,过滤污染后,通过profile搜索和系统发育重建细化为mLECA-OGs,并注释功能。
Gene ancestries reveal diverse microbial associations during eukaryogenesis
研究基于计算分析,包括多数据集系统发育重建、负对照和功能推断,但缺乏体外或体内实验验证。
最后真核共同祖先(LECA)蛋白质组
三个部分重叠的eTOLDB数据集(eTOLDBA、eTOLDBB、eTOLDBC) LECA标准(至少5个物种、3或5个超群、两个主要茎) 系统发育分配阈值(UFBS>75%,分类学bootstrap>95%,供体确定性>95%) 分支长度比率方法用于推断获取时间
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
重建LECA的蛋白质组,以识别可能存在于祖先中的基因家族。
构建了三个100蛋白质组数据集(eTOLDB),聚类为直系同源群(OG),根据物种分布定义LECA-OG,过滤污染后,通过profile搜索和系统发育重建细化为mLECA-OGs,并注释功能。
确定每个基因家族的祖先来源,区分创新、获取和未知。
对每个mLECA-OG重建最大似然树,使用严格阈值分配姐妹群,识别直接获取和病毒介导获取,并应用负对照验证非α变形菌来源。
估计不同供体基因获取的相对时间,以识别转移波。
使用分支长度比率方法计算归一化茎长,通过贝叶斯框架推断每个供体的获取模式,并比较分布峰值。
推断每个供体在LECA中的功能贡献和代谢特征。
基于KEGG注释和COG分类,计算每个供体对LECA代谢模块的贡献,并重建供体基因组中的代谢途径。
按研究目的归类文中使用的方法,便于定位所需技术。
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| eTOLDB数据集构建 | 物种选择、序列过滤标准(BUSCO完整性、低复杂度区域比例) 阅读提示:Methods: eTOLDB construction |
| LECA-OG重建 | LECA标准(至少5个物种、3或5个超群、两个茎)、聚类参数(MMseqs2阈值、OrthoFinder参数) 阅读提示:Methods: LECA-OG reconstruction |
| 系统发育分配 | 阈值(UFBS>75%、分类学bootstrap>95%、供体确定性>95%) 阅读提示:Methods: 'Stress test' for identification of main non-eukaryotic contributors |
| 获取时间推断 | 分支长度比率方法、gamma分布拟合参数 阅读提示:Methods: Inferring the acquisition waves |