模型开发与解释性扩展
使基础组织分类模型适应异质性数据,并提供可解释的预测。
基于34种健康组织的公共蛋白质组数据训练随机森林模型,并扩展SHAP值重构组织评分,实现每个蛋白质的贡献分解;采用per-sample min-max归一化以适应不同模态;引入惩罚因子处理缺失蛋白。
MLMarker: a machine learning framework for tissue inference and biomarker discovery
包含算法开发、模拟实验、三个公共数据集的独立验证及SHAP解释性分析,涵盖多种数据来源和验证层次。
脑黑色素瘤转移样本(PXD007592) 脑脊液样本(PXD008029) 血浆样本(PXD008029) 泛癌FFPE组织样本(MSV000095036)
训练数据集:34种健康组织,固定特征空间包含5,979个蛋白质 惩罚因子λ的值及启用条件(λ=1或自适应函数) 数据预处理:per-sample min-max normalization,缺失蛋白置为零 再处理流程:ionbot肽鉴定、FlashLFQ定量、MSqRob2差异表达分析 组织映射策略:严格映射和扩展映射的准确率评估
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
使基础组织分类模型适应异质性数据,并提供可解释的预测。
基于34种健康组织的公共蛋白质组数据训练随机森林模型,并扩展SHAP值重构组织评分,实现每个蛋白质的贡献分解;采用per-sample min-max归一化以适应不同模态;引入惩罚因子处理缺失蛋白。
评估不同缺失场景下惩罚因子对预测性能的影响。
在肝组织(PXD009021)和脑脊液(PXD008029)数据上模拟三种缺失机制(MCAR、MNAR、定向缺失),改变缺失率和惩罚因子(固定和自适应),评估top-1准确率、排名稳定性和过度校正。
探究脑转移瘤的组织来源,并验证MLMarker能否揭示隐藏的亚结构。
重新处理PXD007592数据(ionbot鉴定、FlashLFQ定量、MSqRob2差异表达),应用MLMarker计算组织相似性,分析脑相似性与治疗反应的关系,并进行SHAP分析和差异表达分析分层。
评估MLMarker在生物体液样本上的适用性,并展示惩罚因子的作用。
对PXD008029的脑脊液和血浆样本计算组织相似性评分,比较惩罚因子使用前后的排名变化,并通过SHAP分析识别关键贡献蛋白。
评估MLMarker在多种癌症组织中的分类性能,并比较与参考图谱方法的优劣。
使用MSV000095036的处理后数据,应用MLMarker预测组织来源,计算top-1和top-k准确率,并与基于人类蛋白质图谱、ProteomicsDB和MLMarker训练图谱的Spearman相关和KNN方法比较。
按研究目的归类文中使用的方法,便于定位所需技术。
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 模型训练 | 训练数据:34种健康组织;特征空间:5,979个蛋白质;固定特征验证和归一化 阅读提示:MLMarker package部分 |
| 数据重处理 | ionbot鉴定参数(前体质量容差±10 ppm,片段质量容差±20 ppm,PSM FDR<1%);FlashLFQ定量(match-between-runs关闭);MSqRob2差异表达(log2转换,中位数中心化,至少4个样本检测,BH校正α=0.01) 阅读提示:Materials and methods: Reprocessing pipeline |
| 惩罚因子模拟 | 模拟数据:PXD009021(肝)和PXD008029(脑脊液);缺失机制:MCAR、MNAR、定向;缺失率0-80%;重复10次;λ值固定和自适应 阅读提示:Materials and methods: Penalty factor evaluation |
| 组织相似性预测 | 输入数据格式:样本×蛋白质矩阵;缺失蛋白置零;per-sample min-max归一化;惩罚因子λ=1或自适应;SHAP值计算 阅读提示:MLMarker package部分 |
| 脑黑色素瘤数据分析 | 样本分组:良好反应(PFS≥6个月)vs不良(PFS<3个月);MLMarker脑相似性评分比较;差异表达分析分组:脑预测vs非脑预测 阅读提示:Results: Cerebral melanoma metastases部分及图4、图7 |