构建膨胀的TE参考数据库
覆盖所有潜在TE编码区域,避免因转录本丰度或翻译证据而遗漏。
从基因组注释中提取TE区域,进行六框翻译,分割终止密码子,过滤长度≥8个氨基酸的序列,并注释TE类别/亚家族。
TIPs: a deep learning-guided proteogenomic framework to expand the landscape of transposable element-derived antigens with immunopeptidomics
研究包含多层级验证:数据库构建、从头测序、多引擎搜索、FDR控制、HLA结合预测、合成肽验证、RNA-seq分析、Ribo-seq过滤及跨样本比较。
黑色素瘤细胞系(0D5P、0NVC、T1185B) 非小细胞肺癌肿瘤及配对正常组织 胶质母细胞瘤细胞系(U-87、T98G、LNT-229)
TIPs数据库构建参数:六框翻译、最小长度8个氨基酸、去冗余。 从头测序质量阈值:每个氨基酸置信度≥0.75,标签长度≥8个氨基酸。 搜索参数:前体离子和碎片离子容忍度20 ppm,无酶特异性,甲硫氨酸氧化可变修饰,肽长度8-15个氨基酸。 FDR控制:分组FDR控制在肽水平,默认3% FDR。 DAC处理条件:细胞系(U-87、T98G、LNT-229、0D5P、0NVC)中DAC处理,具体剂量和时间文中未明确说明。
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
覆盖所有潜在TE编码区域,避免因转录本丰度或翻译证据而遗漏。
从基因组注释中提取TE区域,进行六框翻译,分割终止密码子,过滤长度≥8个氨基酸的序列,并注释TE类别/亚家族。
从质谱数据中获取序列标签,用于指导数据库精简。
使用三种从头测序算法(Casanovo, PepNet, InstaNovo)并行处理质谱数据,并提取高置信度标签。
缩小搜索空间,提高搜索效率和准确性。
将高置信度标签与膨胀TE数据库比对,保留至少有1个完全匹配标签的TE蛋白条目,并排除与人类蛋白质组重叠的序列。
鉴定TE衍生肽,并控制FDR。
将精简TE数据库添加到人类蛋白质组,使用三种搜索引擎进行搜索,应用PeptideProphet和iProphet进行验证和整合,进行分组FDR控制,并用MixMHCpred预测HLA结合亲和力。
评估TIPs相对于现有方法的灵敏度和可靠性。
与NewAnce在多个样本上比较鉴定肽数、结合肽比例和质量;评估TE衍生肽的理化性质、保留时间、HLA结合特性,并用合成肽验证关键肽段。
研究TE亚家族特性对肽呈现的影响。
分析TE衍生肽在不同TE类别和亚家族中的分布,计算与拷贝数和插入时间的相关性,评估重叠性和特异性。
识别肿瘤特异性和药物诱导的TE衍生肽,并评估其靶向潜力。
比较DAC处理细胞系和肿瘤组织与对照之间TE衍生肽的差异,应用三阶段过滤(去除对照中发现的、正常组织有翻译证据的、胸腺呈递的)鉴定特异肽,并分析复发肽。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 合成肽验证 | Orbitrap Exploris 480质谱仪 | Thermo Scientific | -- |
| Genscript合成肽 | Genscript | -- | |
| 数据库构建 | bedtools getfasta | -- | -- |
| seqkit translate | -- | -- | |
| 标签比对 | BLAST+ blastp-short | -- | -- |
| RNA-seq数据处理 | FastQC | -- | -- |
| Trimmomatic | -- | -- | |
| RNA-seq比对 | STAR | -- | -- |
| RNA-seq分析 | TEtranscripts | -- | -- |
| 统计验证 | PeptideProphet | -- | -- |
| iProphet | -- | -- | |
| 数据库搜索 | MSFragger | -- | -- |
| MS-GF+ | -- | -- | |
| Comet | -- | -- | |
| HLA结合预测 | MixMHCpred | -- | -- |
| 肽段保留时间预测 | DeepLC | -- | -- |
| 序列比对 | MEGA12 | -- | -- |
| 序列可视化 | TBtools | -- | -- |
| RNA-seq定量 | featureCounts | -- | -- |
| RNA-seq分析 | OmicVerse | -- | -- |
| DAC处理 | 地西他滨 | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 免疫肽质谱数据处理 | RAW文件来源(PXD013649, PXD034772, PXD003790)及转换工具版本(ThermoRawFileParser v1.4.5)。 阅读提示:Methods: Mass spectrometric data preparation |
| TE数据库构建 | 基因组版本(hg38?),六框翻译参数(-f 6, --append-frame, -m 8, -s),最小长度8个氨基酸。 阅读提示:Methods: In silico TE database construction; Step 1 of TIPs search workflow |
| 从头测序标签提取 | 三种从头测序算法(Casanovo v2, PepNet v2.0, InstaNovo v1.0.0)的参数,最小置信度0.75和标签长度8。 阅读提示:Methods: Step 2 of TIPs search workflow |
| 数据库搜索 | 搜索引擎版本(MSFragger v4.1, MS-GF+ v2023.01.12, Comet v2021.01),参数:20 ppm容忍度,无酶特异性,甲硫氨酸氧化,肽长度8-15。 阅读提示:Methods: Step 4 of TIPs search workflow |
| 统计验证和FDR控制 | PeptideProphet v5.2.1, iProphet v5.01, Philosopher v5.1.0;分组FDR控制在肽水平,3% FDR。 阅读提示:Methods: Step 4 of TIPs search workflow |
| 合成肽验证 | 合成肽来源(Genscript),纯度>95%,质谱仪型号(Orbitrap Exploris 480),色谱条件(45分钟梯度,0.1%甲酸,1% DMSO),PRM参数。 阅读提示:Methods: Validation of TE-derived peptides with synthetic standards |
| DAC处理 | DAC浓度和持续时间:文中未明确说明。 阅读提示:Results: Novel antigens derived from non-coding regions of SVA elements; Figure legends (Fig. 5) |