TIPs:一种深度学习引导的蛋白质基因组学框架,通过免疫肽组学扩展转座子衍生抗原的图景

TIPs: a deep learning-guided proteogenomic framework to expand the landscape of transposable element-derived antigens with immunopeptidomics

作者信息Qian Wu, Xinyue Zhou, Qizhen Feng, Zixiang Shang, Jiayi Shen, Xiaoxiang Huang, Xiaobin Liu, Wenguang Shao
PMID42436584
发布时间2026-07-11
DOI10.1186/s13059-026-04191-y

实验完整度

研究包含多层级验证:数据库构建、从头测序、多引擎搜索、FDR控制、HLA结合预测、合成肽验证、RNA-seq分析、Ribo-seq过滤及跨样本比较。

主要模型

黑色素瘤细胞系(0D5P、0NVC、T1185B) 非小细胞肺癌肿瘤及配对正常组织 胶质母细胞瘤细胞系(U-87、T98G、LNT-229)

重点核对

TIPs数据库构建参数:六框翻译、最小长度8个氨基酸、去冗余。 从头测序质量阈值:每个氨基酸置信度≥0.75,标签长度≥8个氨基酸。 搜索参数:前体离子和碎片离子容忍度20 ppm,无酶特异性,甲硫氨酸氧化可变修饰,肽长度8-15个氨基酸。 FDR控制:分组FDR控制在肽水平,默认3% FDR。 DAC处理条件:细胞系(U-87、T98G、LNT-229、0D5P、0NVC)中DAC处理,具体剂量和时间文中未明确说明。

摘要

转座子(TE)是HLA呈递抗原的丰富且重要来源,但由于搜索空间膨胀,其免疫肽组学表征仍具挑战。我们提出TIPs(TE衍生免疫肽组学搜索),一种深度学习引导的蛋白质基因组学框架,整合了从头测序、数据库精简、多种搜索引擎和严格的FDR控制。在不同细胞系和癌症类型中,TIPs平均鉴定出的TE衍生肽比传统方法多20倍。它进一步揭示了许多复发性的、肿瘤特异性的TE衍生抗原,包括表观遗传治疗诱导的候选抗原。这些发现凸显了TIPs扩展超越经典来源的抗原图景的潜力。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
如何准确且灵敏地鉴定免疫肽组学数据中TE衍生肽,并表征其在肿瘤中的呈现特征?
核心机制
TIPs通过整合从头测序标签和精简TE数据库,提高了TE衍生肽的鉴定灵敏度;TE衍生肽的呈现主要受TE亚家族的基因组拷贝数和进化年龄影响,且具有肿瘤特异性。
主要证据
在多个细胞系和肿瘤样本中,TIPs平均鉴定出比NewAnce多20倍的TE衍生肽,且83.4%被预测为HLA结合肽;通过合成肽验证了LINE-1 ORF和ERV衍生肽;DAC处理诱导了SVA衍生肽的呈现。
研究意义
TIPs扩展了肿瘤抗原图景,为癌症免疫治疗提供了潜在的“现货型”靶点,并可能应用于其他非经典肽的鉴定。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

构建膨胀的TE参考数据库

覆盖所有潜在TE编码区域,避免因转录本丰度或翻译证据而遗漏。

从基因组注释中提取TE区域,进行六框翻译,分割终止密码子,过滤长度≥8个氨基酸的序列,并注释TE类别/亚家族。

2

提取高置信度从头测序标签

从质谱数据中获取序列标签,用于指导数据库精简。

使用三种从头测序算法(Casanovo, PepNet, InstaNovo)并行处理质谱数据,并提取高置信度标签。

3

生成样本特异性的精简TE数据库

缩小搜索空间,提高搜索效率和准确性。

将高置信度标签与膨胀TE数据库比对,保留至少有1个完全匹配标签的TE蛋白条目,并排除与人类蛋白质组重叠的序列。

4

数据库搜索、统计验证和整合

鉴定TE衍生肽,并控制FDR。

将精简TE数据库添加到人类蛋白质组,使用三种搜索引擎进行搜索,应用PeptideProphet和iProphet进行验证和整合,进行分组FDR控制,并用MixMHCpred预测HLA结合亲和力。

5

性能基准测试与验证

评估TIPs相对于现有方法的灵敏度和可靠性。

与NewAnce在多个样本上比较鉴定肽数、结合肽比例和质量;评估TE衍生肽的理化性质、保留时间、HLA结合特性,并用合成肽验证关键肽段。

6

TE衍生肽的基因组特征分析

研究TE亚家族特性对肽呈现的影响。

分析TE衍生肽在不同TE类别和亚家族中的分布,计算与拷贝数和插入时间的相关性,评估重叠性和特异性。

7

DAC处理和肿瘤发生诱导的TE抗原分析

识别肿瘤特异性和药物诱导的TE衍生肽,并评估其靶向潜力。

比较DAC处理细胞系和肿瘤组织与对照之间TE衍生肽的差异,应用三阶段过滤(去除对照中发现的、正常组织有翻译证据的、胸腺呈递的)鉴定特异肽,并分析复发肽。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
Orbitrap Exploris 480质谱仪Thermo Scientific--
Genscript合成肽Genscript--
bedtools getfasta----
seqkit translate----
BLAST+ blastp-short----
FastQC----
Trimmomatic----
STAR----
TEtranscripts----
PeptideProphet----
iProphet----
MSFragger----
MS-GF+----
Comet----
MixMHCpred----
DeepLC----
MEGA12----
TBtools----
featureCounts----
OmicVerse----
地西他滨----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
免疫肽质谱数据处理
RAW文件来源(PXD013649, PXD034772, PXD003790)及转换工具版本(ThermoRawFileParser v1.4.5)。
阅读提示:Methods: Mass spectrometric data preparation
TE数据库构建
基因组版本(hg38?),六框翻译参数(-f 6, --append-frame, -m 8, -s),最小长度8个氨基酸。
阅读提示:Methods: In silico TE database construction; Step 1 of TIPs search workflow
从头测序标签提取
三种从头测序算法(Casanovo v2, PepNet v2.0, InstaNovo v1.0.0)的参数,最小置信度0.75和标签长度8。
阅读提示:Methods: Step 2 of TIPs search workflow
数据库搜索
搜索引擎版本(MSFragger v4.1, MS-GF+ v2023.01.12, Comet v2021.01),参数:20 ppm容忍度,无酶特异性,甲硫氨酸氧化,肽长度8-15。
阅读提示:Methods: Step 4 of TIPs search workflow
统计验证和FDR控制
PeptideProphet v5.2.1, iProphet v5.01, Philosopher v5.1.0;分组FDR控制在肽水平,3% FDR。
阅读提示:Methods: Step 4 of TIPs search workflow
合成肽验证
合成肽来源(Genscript),纯度>95%,质谱仪型号(Orbitrap Exploris 480),色谱条件(45分钟梯度,0.1%甲酸,1% DMSO),PRM参数。
阅读提示:Methods: Validation of TE-derived peptides with synthetic standards
DAC处理
DAC浓度和持续时间:文中未明确说明。
阅读提示:Results: Novel antigens derived from non-coding regions of SVA elements; Figure legends (Fig. 5)