人类增强子与启动子序列的兼容性规则

Compatibility rules of human enhancer and promoter sequences

作者信息Drew T Bergman, Thouis R Jones, Vincent Liu, Judhajeet Ray, Evelyn Jagoda, Layla Siraj, Helen Y Kang, Joseph Nasser, Michael Kane, Antonio Rios, Tung H Nguyen, Sharon R Grossman, Charles P Fulco, Eric S Lander, Jesse M Engreitz
PMID35594906
期刊Nature
发布时间2022-07
DOI10.1038/s41586-022-04877-w

实验完整度

包含ExP STARR-seq高通量报告系统、CRISPRi数据、HS-STARR-seq、荧光素酶报告实验、基因表达谱分析及转录因子扰动实验等多个独立证据层级。

主要模型

K562细胞(人类红白血病细胞系) ExP STARR-seq报告质粒系统 小鼠胚胎干细胞(用于平行研究分析)

重点核对

增强子与启动子序列各264-bp,克隆间隔约340-bp 每个增强子-启动子对平均有6.3个质粒条形码 K562细胞转染实验:4个生物学重复,每个重复5000万细胞 测序深度:RNA至少26亿读长,DNA至少4.7亿读长 分析阈值:每个质粒DNA读数≥25,RNA读数≥1

摘要

人类基因组中的基因调控由远端增强子控制,这些增强子激活特定的邻近启动子1。这种特异性的一种模型是,启动子可能具有序列编码的偏好性,以选择某些增强子,例如通过相互作用的一组转录因子或辅因子来介导2。这种“生化兼容性”模型已得到单个人类启动子的观察和果蝇全基因组测量的支持3-9。然而,人类增强子和启动子内在兼容的程度尚未得到系统测量,它们的活性如何组合以控制RNA表达仍不清楚。在这里,我们设计了一种名为ExP STARR-seq(增强子×启动子自转录活性调控区域测序)的高通量报告基因检测方法,并将其应用于检查人类K562细胞中1,000个增强子和1,000个启动子序列的组合兼容性。我们确定了增强子-启动子兼容性的简单规则:大多数增强子对所有启动子的激活程度相似,并且内在的增强子和启动子活性以乘法方式组合以决定RNA输出(R2=0.82)。此外,两类增强子和启动子显示出微妙的偏好效应。看家基因的启动子含有内置的激活基序,如GABPA和YY1,这降低了启动子对远端增强子的响应性。可变表达基因的启动子缺乏这些基序,并对增强子表现出更强的响应性。总之,这种对增强子-启动子兼容性的系统评估表明,存在一个受增强子和启动子类别调节的乘法模型,以控制人类基因组中的基因转录。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
人类增强子和启动子序列是否具有内在兼容性,以及它们的活性如何组合以控制RNA表达?
核心机制
增强子和启动子活性以乘法方式组合来决定RNA输出,且启动子类(如看家基因启动子)通过内置GABPA和YY1等激活基序来降低对远端增强子的响应性。
主要证据
ExP STARR-seq显示大多数增强子对所有启动子的激活程度相似,乘法模型解释82%的方差;看家基因启动子(P2)含GABPA/YY1基序,其响应性低于可变表达基因启动子(P1),且基序插入或破坏实验验证了其功能。
研究意义
该研究揭示了人类增强子-启动子兼容性的简单规则,有助于建模基因表达、绘制人类遗传变异效应,并设计用于基因治疗的调控序列。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

构建ExP STARR-seq报告文库

创建包含1000个增强子和1000个启动子的所有成对组合的质粒文库,以系统测量增强子-启动子兼容性。

合成264-bp序列,克隆至hSTARR-seq_SCP1载体,通过Gibson组装生成约100万个组合,引入16-bp质粒条形码。

2

测量增强子和启动子活性

定量每个增强子-启动子组合的表达水平,并估计单个增强子和启动子的内在活性。

瞬转质粒池至K562细胞,提取RNA,STARR-seq测序,计算RNA/DNA比率作为STARR-seq表达。

3

评估增强子和启动子兼容性

测试增强子是否能特异性激活某些启动子,以及是否存在兼容性类别。

计算增强子-启动子对之间的相关性,拟合乘法泊松模型,聚类残差以鉴定E1/E2和P1/P2类别。

4

表征增强子和启动子类别

确定E1/E2和P1/P2类别的分子特征,以及它们如何编码兼容性。

比较类别的基因注释、染色质特征(如H3K27ac、DNase)、转录因子结合(如GABPA、YY1)、基序分析、CRISPRi数据等。

5

验证乘法模型和类别特异的调控机制

验证乘法模型以及GABPA/YY1基序对启动子响应性的影响。

进行荧光素酶报告实验验证乘法模型;进行基序插入/破坏实验(motif ExP STARR-seq)验证GABPA/YY1对响应性的影响。

6

评估在基因组中的相关性

评估从报告基因实验中得出的规则是否适用于内源基因组背景。

使用PRO-seq测量基因转录,ABC模型计算增强子输入,回归分析乘法模型与基因表达的关系。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
hSTARR-seq_SCP1载体_blocking 4Addgene99319
Q5热启动高保真DNA聚合酶NEBM0492
AMPure XP磁珠Beckman CoulterA63881
Gibson组装预混液NEBE2611
Endura电转感受态细胞Lucigen60242
Gene Pulser Xcell微生物电穿孔系统BioRad--
ZymoPURE II质粒中提试剂盒Zymo ResearchD4200
RPMI-1640培养基Thermo Fisher Scientific--
胎牛血清Thermo Fisher Scientific--
4D-Nucleofector电转仪Lonza--
RNeasy小提试剂盒Qiagen74134
Oligotex mRNA试剂盒Qiagen--
TURBO DNA-free试剂盒Thermo Fisher ScientificAM2238
RNA清洁与浓缩-5Zymo ResearchR1013
SuperScript IV反转录酶Thermo Fisher Scientific--
RNaseOUT重组核糖核酸酶抑制剂Invitrogen10777019
RNase HThermo Fisher ScientificEN0201
SPRIselect磁珠Beckman CoulterB23318
Illumina测序Illumina--
双荧光素酶报告基因检测Promega--

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
ExP STARR-seq文库构建
增强子和启动子序列长度264-bp,间隔约340-bp,质粒条形码16-bp
阅读提示:Methods: Design of ExP STARR-seq, Library Cloning
细胞培养与转染
K562细胞系,转染细胞数10百万/次,质粒量15μg,电转程序T-016
阅读提示:Methods: Cell Culture, Library Transfection
测序与数据分析
RNA和DNA文库测序深度(至少26亿和4.7亿读长),分析阈值(DNA≥25,RNA≥1),至少2个质粒条形码
阅读提示:Methods: STARR-seq Library Preparation, Alignment and counting of STARR-seq data
乘法模型拟合
泊松模型参数:k, P, E;使用至少25 DNA reads和至少1 RNA read的质粒
阅读提示:Methods: Estimating intrinsic enhancer and promoter activities — multiplicative model