分析纵向变异轨迹(Logistic拟合)
描述CH变异随年龄的变化模式,并识别轨迹类型(增长、下降、饱和),以推断观察生长率rlog的分布。
对385例个体的697条CH变异轨迹,用逻辑增长函数进行最大似然拟合,假设VAF为二项分布,得到每变异轨迹的rlog,并按年龄分层分析增长/下降/饱和轨迹的比例及平均rlog的变化。
The Evolution of Polyclonal Competition in Aging Hematopoiesis
研究包含多个独立数据层:纵向变异轨迹(697条)、单细胞WGS数据(9例供体)、多队列聚合数据(1942例),并整合随机模拟与ABC推断进行功能与机制验证。
人类造血干细胞(HSC)群体 克隆性造血(CH)的纵向变异轨迹队列(385例,697条轨迹) 单细胞全基因组测序(WGS)的HSC克隆(9例供体)
变异的生长率(rlog)拟合采用逻辑增长模型,假设VAF测量符合二项分布,需核对覆盖度V和拟合参数 ABC推断采用均匀先验:η∈[0.01,0.4],σ∈[0.001,0.1],μ∈[0.1,30],需核对先验范围及后验分布 轨迹数据阈值:移除VAF<1%(Fabre和van Zeventer数据),Robertson数据阈值<1.5%,需核对阈值处理 SFS推断:使用WGS数据构建SFS,比较采用Wasserstein距离和1%频率以上克隆数,需核对克隆定义与阈值 基因分析:2组分高斯混合聚类阈值sT=0.226,需核对聚类方法与阈值 方差分析:仅考虑常见变异(DNMT3A.R882H/C和JAK2.V617F),需核对样本量及标准差计算
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
描述CH变异随年龄的变化模式,并识别轨迹类型(增长、下降、饱和),以推断观察生长率rlog的分布。
对385例个体的697条CH变异轨迹,用逻辑增长函数进行最大似然拟合,假设VAF为二项分布,得到每变异轨迹的rlog,并按年龄分层分析增长/下降/饱和轨迹的比例及平均rlog的变化。
模拟多克隆竞争下HSC克隆频率动态,以解释数据中观察到的轨迹模式(如下降轨迹随年龄增加)并生成可用于推断的模拟数据。
假设HSC群体大小固定,新克隆按泊松过程到达,固有适应度从伽马分布抽样,利用公式dxi(t)=(si-∑sxj)dt+B(t)dWt模拟克隆频率变化,并使用Gillespie算法验证。
检验多克隆竞争模型预测的HSC SFS随年龄的转变(从1/f²到1/f再返回1/f²)与实际单细胞WGS数据的一致性。
利用9例0-81岁供体的单细胞WGS数据(每例200-500个HSC)构建SFS,与包含中性突变积累的agent-based模拟结果比较,使用Kolmogorov-Smirnov检验评估一致性,并分析SFS在婴儿、青年和老年期的标度律变化。
从纵向轨迹和HSC SFS两种独立数据源推断CH进化参数(固有适应度分布均值η、SDσ、到达率μ),并验证参数可识别性。
使用对轨迹数据(700条,400供体)和SFS数据(9单细胞供体)的ABC方法。从先验分布随机采样65000参数组合,分别模拟轨迹或SFS,计算与数据的距离度量,保留1%分位数后验。比较后验的中心趋势并用于预测。
推断单个CH变异的固有适应度s和到达时间t0,以区分单事件和多击进化。
对1942条轨迹分别执行ABC,将模拟轨迹与目标轨迹比较。模拟时插入单个具有预先设定适应度s和到达时间t的克隆,匹配最佳参数。从150,000模拟中取最相似的0.1%构建后验,用KDE峰值估计s和t0。
检测不同CH基因的固有适应度是否不同,并估计多克隆竞争可解释的观察生长率变异的比例。
对常见变异的估计适应度分布,使用Fisher精确检验比较DNMT3A与其他基因高适应度(>sT)富集;模拟相同变异固定固有适应度s=0.15的1,000轨迹进行方差分析,计算模型可解释方差比例。
按研究目的归类文中使用的方法,便于定位所需技术。
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 纵向变异轨迹数据 | 数据来源:Fabre et al.、Robertson et al.、van Zeventer et al.;阈值:VAF<1%或<1.5%被移除;样本量:1969无血液恶性肿瘤个体;随访时间中位13年(Fabre) 阅读提示:Methods:Aggregated Trajectory Datasets;Results:图1B |
| 单细胞WGS数据 | 数据:Mitchell et al.;9例供体,年龄0-81岁;细胞数每例216-451个(平均362);构建SFS 阅读提示:Methods:WGS of HSC Colonies;Results:图2B-D |
| 模型参数 | 模型参数:η=0.07-0.09/年, σ=0.025, μ=3/年(后验);先验范围:η∈[0.01,0.4], σ∈[0.001,0.1], μ∈[0.1,30];N和τ固定为105和1年 阅读提示:Methods:ABC参数推断;Results:图3F-H |
| 单轨迹ABC推断 | 轨迹数:1942条;模拟数:150,000;先验:s∈U(0.01,2), t∈U(0,90);保留距离最小的0.1% 阅读提示:Methods:Bayesian Inference on Individual Trajectories;Results:图4D-E |
| 基因比较分析 | 基因列表:DNMT3A, TET2, ASXL1, JAK2, SF3B1, SRSF2;高适应度阈值:sT=0.226 阅读提示:Methods:Results中对基因分析;图4G-I |
| 方差分析 | 变异:DNMT3A.R882H/C和JAK2.V617F;固定s=0.15进行模拟;样本量:47和46条轨迹 阅读提示:Methods:Bayesian Inference on Individual Trajectories;Results:图4G |