转座子动态驱动燕麦属着丝粒结构的快速进化

Transposable element dynamics drive rapid evolution of centromere architecture in the Avena genus

作者信息Carlotta Marie Wehrkamp, Matthias Heuberger, Thomas Wicker
PMID42304491
发布时间2026-06-16
DOI10.1186/s13059-026-04127-6

实验完整度

基于公开基因组和CENH3 ChIP-seq数据进行生物信息学分析,包括TE注释、系统发育和插入年龄估计,但缺乏湿实验验证。

主要模型

六倍体燕麦A. sativa OT3098基因组 四倍体A. insularis基因组 二倍体A. longiglumis、A. atlantica、A. eriantha基因组

重点核对

着丝粒位置由CENH3 ChIP-seq数据推断,来源于不同品系A. sativa cv. Starter TE插入年龄估计使用1.3E-8替换率/位点/年 TE亚家族通过PCA和系统发育分析定义 RLG_Ava和RLG_Cereba全长度拷贝数在不同亚基因组中有差异 着丝粒中串联重复含量通过TRF和EDTA注释

摘要

背景:最近,近乎无间隙的高质量基因组组装方面的进展,使得对大型且高度重复的作物基因组中着丝粒的详细分析成为可能。在这里,我们分析了六倍体燕麦(Avena sativa)及其四倍体(Avena insularis)和二倍体近缘种(Avena longiglumis、Avena atlantica 和 Avena eriantha)的着丝粒。结果:燕麦着丝粒主要由属于三个家族的逆转录转座子组成,即 RLG_Ava、RLG_Cereba 和 RLG_Beth。对逆转录转座子群体的比较分析揭示了 A、C 和 D 亚基因组谱系之间着丝粒组成和结构的显著差异。我们鉴定了这些谱系不同的转座子爆发特征,包括逆转录转座子家族和亚家族的兴起与丢失。此外,我们在燕麦(Avena sativa)的着丝粒区域内鉴定了多个倒位,并追溯了燕麦属中的物种分化和多倍化事件。尽管亲缘关系很近,我们的数据显示所研究的物种表现出着丝粒结构的快速且分歧的进化,例如通过新卫星重复序列的扩散或不同逆转录转座子家族和亚家族的活性爆发。此外,我们发现 RLG_Ava 和 RLG_Cereba 逆转录转座子自禾本科出现以来一直共存并可能竞争着丝粒“生态位”。结论:我们的比较分析提供了对燕麦属着丝粒进化的详细见解,并揭示了即使在密切相关的物种和不同倍性水平之间,着丝粒的组成和结构也可能存在很大差异。我们的发现强调需要对大型基因组物种进行扩展分析,以提高我们对着丝粒进化的理解。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
不同倍性和亲缘关系的燕麦属物种中,着丝粒的组成、结构及进化动态如何?
核心机制
着丝粒主要由CRM逆转录转座子RLG_Ava和RLG_Cereba组成,它们竞争着丝粒生态位,且其活性爆发和丢失驱动着丝粒快速进化。
主要证据
基于高质量基因组组装和CENH3 ChIP-seq数据,通过TE注释、插入年龄估计、系统发育和PCA分析,揭示了亚基因组间着丝粒组成的差异和倒位事件。
研究意义
强调了对大基因组物种进行扩展分析的必要性,以加深对着丝粒进化的理解。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

着丝粒定位

利用CENH3 ChIP-seq数据推断A. sativa OT3098的着丝粒位置

将A. sativa cv. Starter的CENH3 ChIP-seq reads比对到OT3098组装,计算覆盖度并设置阈值,推断着丝粒边界

2

TE注释与分类

鉴定着丝粒中的重复序列组成

使用EDTA和TRF对着丝粒区域进行TE和串联重复注释,手动构建TE consensus序列,并进行家族分类

3

TE群体分析

识别全长TE拷贝,估计插入年龄,并分析亚家族多样性

使用TEpop流程鉴定全长RLG_Cereba、RLG_Ava、RLG_Beth和RLG_Aurora拷贝,计算LTR分歧度估计插入年龄,通过PCA和系统发育定义亚家族

4

比较和系统发育分析

研究不同Avena物种和禾本科中TE家族的进化关系

基于TE蛋白序列构建系统发育树,分析不同物种和亚基因组的TE亚家族存在与否和活性爆发时间

5

着丝粒结构比较

比较不同亚基因组着丝粒组成差异

统计着丝粒中不同类型的重复序列比例,包括TE和串联重复

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
EDTA----
串联重复查找器----
TREP数据库----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
着丝粒定位
CENH3 ChIP-seq数据来源(A. sativa cv. Starter)与目标基因组(A. sativa OT3098)是否匹配,阈值设置(最大覆盖度的25%)
阅读提示:Methods 'Centromere position estimation'部分
TE注释
EDTA版本(v2.2.1)、参数设置、输入库(TREP v.19子集)
阅读提示:Methods 'TE annotation'部分
TE群体分析
TEpop流程参数、LTR提取和插入年龄估计方法(替换率1.3E-8)
阅读提示:Methods 'TE population analysis'部分
系统发育分析
序列来源、比对工具(MAFFT v7.526)和系统发育构建参数(MrBayes或RAxML-NG)
阅读提示:Methods 'Phylogenetic analysis of centromere specific retrotransposon consensus sequences'和'Phylogenetic analysis of individual TE copies'部分
着丝粒结构比较
串联重复注释(TRF参数)、着丝粒区域定义
阅读提示:Methods 'Tandem-repeat analysis'部分