人类转录因子DNA结合特异性的扩展码本

An expanded codebook of human transcription factor DNA-binding specificity

作者信息Arttu Jolma, Kaitlin U Laverty, Ali Fathi, Ally W H Yang, Isaac Yellan, Ilya E Vorontsov, Antoni J Gralak, Judith F Kribelbauer-Swietek, Sachi Inukai, Rozita Razavi, Mihai Albu, Alexander Brechalov, Zain M Patel, Vladimir Nozdrin, Georgy Meshcheryakov, Andrey Buyan, Ivan Kozin, Sergey Abramov, Alexandr Boytsov, Codebook Consortium, Quaid Morris, Matthew T Weirauch, Oriol Fornes, Vsevolod J Makeev, Jan Grau, Ivo Grosse, Philipp Bucher, Bart Deplancke, Ivan V Kulakovskiy, Timothy R Hughes, Fedor A Kolpakov, Vsevolod J Makeev, Marjan Barazandeh, Zhenfeng Deng, Chun Hu, Samuel A Lambert, Sara E Pour, Mikhail Salnikov, Hong Zheng, Giovanna Ambrosini, Judith F Kribelbauer-Swietek, Marie-Luise Plescher, Semyon Kolmykov, Ivan Yevshin, Nikita Gryzunov, Mikhail Nikonov, Arsenii Zinkevich, Katerina Faltejskova, Pavel Kravchenko, Vasilii Kamenets, Dmitry Penzar, Anton Vlasov, Aldo Hernandez-Corchado, Hamed S Najafabadi, Xiaoting Chen
PMID42557334
期刊Nature
发布时间2026-09
DOI10.1038/s41586-026-10798-9

实验完整度

包含多平台体外与体内实验(HT-SELEX、SMiLE-seq、PBM、ChIP–seq、GHT-SELEX),鉴定基序并验证其与细胞结合位点和保守性,功能验证充分。

主要模型

HEK293细胞系 体外蛋白质表达系统(PURExpress T7重组IVT系统;SP6驱动的麦胚提取物IVT系统) 人类基因组位点 FANTOM5组织与细胞样本

重点核对

332个等位基因表达数量性状位点,其中74%的等位基因特异性结合与PWM预测一致 HT-SELEX、GHT-SELEX、ChIP–seq和SMiLE-seq等实验平台 对177个成功转录因子进行多平台一致性验证以确定代表性PWM

摘要

基因表达受转录因子(TFs)调控,转录因子识别特定的DNA序列基序。数百种推定的人类转录因子,主要通过明显的DNA结合结构域鉴定,缺乏已知的结合基序。此外,即使对于已充分表征的转录因子,基序在多大程度上准确反映活细胞中的结合位点仍存在争议。在这里,我们描述了一项系统性的工作(“Codebook”),以确定332种推定和表征不佳的人类转录因子的序列特异性。超过4,000个独立实验,涵盖多种体外和体内检测,为刚超过一半(177;53%)的转录因子产生了基序,其中大多数仅与单一蛋白质相关。这些结果将人类转录因子编码的序列识别词汇扩展了约130个独特基序。此外,体外鉴定的结合基序在细胞结合位点中高度富集。总的来说,这些数据揭示了人类基因组中数以万计先前未知的、保守的、直接的转录因子结合位点。这些位点集中在启动子区域,并可预测基因表达。总之,这个新的码本为解码人类基因组提供了重要的一步。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
本研究试图确定332种推定和表征不佳的人类转录因子的DNA序列特异性,并评估其基序在基因组中的功能相关性。
核心机制
转录因子通过序列特异性结合DNA,体外鉴定的基序在细胞结合位点中富集,且基序匹配位点表现出纯化选择,表明这些位点具有功能。
主要证据
通过HT-SELEX、SMiLE-seq、PBM、ChIP–seq和GHT-SELEX等实验及多平台一致性验证,为177个转录因子鉴定了基序;在保守TOP(CTOP)位点中观察到基序匹配的保守性。
研究意义
该研究扩展了人类转录因子基序库,增进了对基因调控、基因组功能和进化的理解。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

蛋白质生产与表达系统验证

为ChIP–seq和SELEX实验生成特异表达的转录因子蛋白,确保其功能活性。

使用三种系统表达蛋白质:FLiP-in HEK293细胞系(强力霉素诱导24小时)、PURExpress T7 IVT系统(基于麦胚提取物的SP6驱动IVT系统)。

2

DNA结合基序的体外鉴定

利用随机序列或基因组DNA片段,在体外测定转录因子的内在DNA序列偏好。

进行HT-SELEX、GHT-SELEX、SMiLE-seq和PBM实验,每种实验根据TF类型和标签选择适当的表达系统。

3

体内细胞结合位点的鉴定

在活细胞环境中确定转录因子的实际结合位点,评估基序在体内的应用。

在HEK293细胞中进行ChIP–seq实验,使用诱导型GFP标记的转基因,并结合GHT-SELEX和基序匹配分析。

4

基序成功验证与代表性PWM选择

通过跨平台一致性验证,选择高准确性、可复现的转录因子基序作为代表。

从多个实验平台产生候选PWM,使用AUROC和Jaccard指数等指标评估其预测能力,并进行专家评审。

5

结合位点的保守性与功能关联分析

确定转录因子结合位点的进化保守性及其与基因组特征、基因表达的关系。

将ChIP–seq峰、GHT-SELEX峰和PWM匹配进行三重优化重叠(TOP)分析,计算位点保守性,并与启动子、CpG岛和其他功能元件进行关联分析。

6

结合位点的变异效应与生物学功能预测

评估转录因子结合位点中的序列变异对等位基因偏好、疾病关联及基因表达的影响。

分析ChIP–seq和GHT-SELEX中的等位基因特异性结合,鉴定疾病相关SNP及表达QTL,通过MARA分析基序对基因表达的预测作用。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
多西环素----
抗eGFP抗体 (ab290)Abcam--
Dynabeads蛋白G磁珠ThermoFisher10004D
蛋白G琼脂糖珠Cytiva28-9670-70
PURExpress体外蛋白质合成试剂盒NEBE6800L
麦胚提取物PromegaL3260

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
蛋白表达
表达系统类型,诱导条件(如强力霉素浓度和时间)
阅读提示:Methods: Protein production
DNA结合基序鉴定
实验平台,蛋白质标签(如GST、eGFP),DNA库类型
阅读提示:Methods: DNA-binding assays; Figure 1
ChIP-seq实验
细胞系,抗体类型和用量,免疫沉淀条件
阅读提示:Methods: DNA-binding assays
数据分析峰集处理
峰检出方法、用于合并评估的随机背景生成、亚阈值
阅读提示:Methods: Post-evaluation peak processing and other sections
基序保守性分析
TOP位点的定义(各数据集阈值)、用于保守性计算的物种数、统计检验类型
阅读提示:Methods: TOP and CTOP peak set analyses; Figure 3
变异分析
有关人类参考基因组或变异检测参数和等位基因读段计数的具体实现
阅读提示:Methods: Variant calling and ASB calling