模型训练
在注释参考数据上训练一个编码器,学习区分不同细胞类型的嵌入空间。
使用多层感知机编码器将标准化的蛋白表达向量映射到低维嵌入,通过监督对比损失(基于马氏距离)优化,使用Adam优化器和早停法。
CellFuse Enables Multimodal Integration of Single-Cell and Spatial Proteomics Data for Systems-Level Analysis in Cancer
包含基准测试、空间数据标注、跨模态整合和功能验证,涉及体外细胞数据、患者样本和空间成像。
骨髓造血细胞(CyTOF/CITE-seq) 外周血单个核细胞(CyTOF/CITE-seq) CAR-T治疗患者样本(CyTOF/CITE-seq) 结直肠癌组织(MIBI-TOF/CyTOF)
共享特征数量:骨髓数据12个共享标记,PBMC数据27个共享标记 训练/验证集划分:参考数据70/30分裂 kNN分类器k值:用户指定,文中未明确说明默认值 模型优化:Adam优化器,早停法 评估指标:scIB指标(NMI, ARI, Silhouette label, iLISI, BRAS)
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
在注释参考数据上训练一个编码器,学习区分不同细胞类型的嵌入空间。
使用多层感知机编码器将标准化的蛋白表达向量映射到低维嵌入,通过监督对比损失(基于马氏距离)优化,使用Adam优化器和早停法。
利用学习到的嵌入空间,通过最近邻分类对查询细胞进行标签预测。
将查询细胞投影到嵌入空间,使用kNN分类器基于参考嵌入预测细胞类型,并提供置信度分数。
调整查询数据的分布,使整合后的数据可用于下游联合分析。
对每个细胞类型,在参考数据定义的主成分空间中进行分位数对齐,并保留零值以维持稀疏性,然后重建整合后表达矩阵。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 模型实现与分类 | scikit-learn | -- | -- |
| 数据降采样 | TidyTOF | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 模型输入数据 | 共享特征标记列表和数量(BM: 12个共享蛋白;PBMC: 27个共享蛋白) 阅读提示:材料和方法-数据集部分 |
| 模型训练设置 | 训练/验证划分比例(70/30) 阅读提示:材料和方法-CellFuse流程-第1阶段 |
| 模型超参数 | kNN的k值、学习率、早停参数(patience和min_delta)、批量大小(未明确说明) 阅读提示:材料和方法-CellFuse流程-第1和第2阶段 |