衰老造血中多克隆竞争的演化

The Evolution of Polyclonal Competition in Aging Hematopoiesis

作者信息Nathaniel V Mon Père, Francesco Terenzi, Benjamin Werner
PMID42084533
发布时间2026-09-01
DOI10.1158/2159-8290.CD-25-0990

实验完整度

高

研究包含多个独立数据层:纵向变异轨迹(697条)、单细胞WGS数据(9例供体)、多队列聚合数据(1942例),并整合随机模拟与ABC推断进行功能与机制验证。

主要模型

人类造血干细胞(HSC)群体 克隆性造血(CH)的纵向变异轨迹队列(385例,697条轨迹) 单细胞全基因组测序(WGS)的HSC克隆(9例供体)

重点核对

变异的生长率(rlog)拟合采用逻辑增长模型,假设VAF测量符合二项分布,需核对覆盖度V和拟合参数 ABC推断采用均匀先验:η∈[0.01,0.4],σ∈[0.001,0.1],μ∈[0.1,30],需核对先验范围及后验分布 轨迹数据阈值:移除VAF<1%(Fabre和van Zeventer数据),Robertson数据阈值<1.5%,需核对阈值处理 SFS推断:使用WGS数据构建SFS,比较采用Wasserstein距离和1%频率以上克隆数,需核对克隆定义与阈值 基因分析:2组分高斯混合聚类阈值sT=0.226,需核对聚类方法与阈值 方差分析:仅考虑常见变异(DNMT3A.R882H/C和JAK2.V617F),需核对样本量及标准差计算

摘要

克隆性造血(CH)——血液中遗传变异体的扩增——是体细胞进化的典型例子。尽管它常常先于恶性转化发生,但这一过程的许多方面仍然未知。我们表明,一个多克隆竞争模型——在该模型中,具有选择性优势的克隆不断出现并相互竞争——能够解释人类一生中观察到的CH动态。我们使用变异轨迹或造血干细胞(HSC)遗传异质性来量化克隆扩增的适应度分布和发生率。对两类数据的推断结果一致。每年大约有3个适应克隆进入HSC池,但一生中很少超过5个克隆达到>1.5%的频率。最适应的克隆主要出现在生命后期,这符合多步骤进化过程。DNMT3A变异富集于单打击克隆,而TET2、ASXL1、JAK2、SF3B1和SRSF2则富集于多打击进化。这些发现提示,血液恶性肿瘤的前体在转化前是可识别的,并可能有助于早期干预策略。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
克隆性造血(CH)在人类一生中的进化动力学如何?多克隆竞争能否解释观察到的CH动态、适应度分布和不同基因的突变倾向?
核心机制
多克隆竞争机制:具有不同固有适应度的克隆在有限的造血干细胞群体中不断出现并竞争,导致群体平均适应度上升,使部分克隆的观察生长率转为下降,解释轨迹动态。此外,克隆进化是多步骤过程,高适应度克隆多为多次驱动突变积累的结果。
主要证据
通过纵向轨迹数据(385例,697条轨迹)和单细胞WGS数据(9例供体)分析生长率分布、SFS转变;ABC推断得出固有适应度分布参数η=0.07-0.09/年、σ=0.025,到达率μ=3/年;模拟与数据一致性验证模型。
研究意义
研究提出CH的进化模型,有助于识别可能进展为恶性血液病的高风险克隆,为早期干预策略提供潜在靶点。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

分析纵向变异轨迹(Logistic拟合)

描述CH变异随年龄的变化模式,并识别轨迹类型(增长、下降、饱和),以推断观察生长率rlog的分布。

对385例个体的697条CH变异轨迹,用逻辑增长函数进行最大似然拟合,假设VAF为二项分布,得到每变异轨迹的rlog,并按年龄分层分析增长/下降/饱和轨迹的比例及平均rlog的变化。

2

建立随机微分方程(SDE)模型并模拟

模拟多克隆竞争下HSC克隆频率动态,以解释数据中观察到的轨迹模式(如下降轨迹随年龄增加)并生成可用于推断的模拟数据。

假设HSC群体大小固定,新克隆按泊松过程到达,固有适应度从伽马分布抽样,利用公式dxi(t)=(si-∑sxj)dt+B(t)dWt模拟克隆频率变化,并使用Gillespie算法验证。

3

重建HSC位点频率谱(SFS)并分析年龄转变

检验多克隆竞争模型预测的HSC SFS随年龄的转变(从1/f²到1/f再返回1/f²)与实际单细胞WGS数据的一致性。

利用9例0-81岁供体的单细胞WGS数据(每例200-500个HSC)构建SFS,与包含中性突变积累的agent-based模拟结果比较,使用Kolmogorov-Smirnov检验评估一致性,并分析SFS在婴儿、青年和老年期的标度律变化。

4

ABC推断CH进化参数

从纵向轨迹和HSC SFS两种独立数据源推断CH进化参数(固有适应度分布均值η、SDσ、到达率μ),并验证参数可识别性。

使用对轨迹数据(700条,400供体)和SFS数据(9单细胞供体)的ABC方法。从先验分布随机采样65000参数组合,分别模拟轨迹或SFS,计算与数据的距离度量,保留1%分位数后验。比较后验的中心趋势并用于预测。

5

单个轨迹的ABC推断(内在适应度和到达时间)

推断单个CH变异的固有适应度s和到达时间t0,以区分单事件和多击进化。

对1942条轨迹分别执行ABC,将模拟轨迹与目标轨迹比较。模拟时插入单个具有预先设定适应度s和到达时间t的克隆,匹配最佳参数。从150,000模拟中取最相似的0.1%构建后验,用KDE峰值估计s和t0。

6

基因特异性和多克隆竞争解释生长率变异

检测不同CH基因的固有适应度是否不同,并估计多克隆竞争可解释的观察生长率变异的比例。

对常见变异的估计适应度分布,使用Fisher精确检验比较DNMT3A与其他基因高适应度(>sT)富集;模拟相同变异固定固有适应度s=0.15的1,000轨迹进行方差分析,计算模型可解释方差比例。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
Rust编程语言----
Python----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
纵向变异轨迹数据
数据来源:Fabre et al.、Robertson et al.、van Zeventer et al.;阈值:VAF<1%或<1.5%被移除;样本量:1969无血液恶性肿瘤个体;随访时间中位13年(Fabre)
阅读提示:Methods:Aggregated Trajectory Datasets;Results:图1B
单细胞WGS数据
数据:Mitchell et al.;9例供体,年龄0-81岁;细胞数每例216-451个(平均362);构建SFS
阅读提示:Methods:WGS of HSC Colonies;Results:图2B-D
模型参数
模型参数:η=0.07-0.09/年, σ=0.025, μ=3/年(后验);先验范围:η∈[0.01,0.4], σ∈[0.001,0.1], μ∈[0.1,30];N和τ固定为105和1年
阅读提示:Methods:ABC参数推断;Results:图3F-H
单轨迹ABC推断
轨迹数:1942条;模拟数:150,000;先验:s∈U(0.01,2), t∈U(0,90);保留距离最小的0.1%
阅读提示:Methods:Bayesian Inference on Individual Trajectories;Results:图4D-E
基因比较分析
基因列表:DNMT3A, TET2, ASXL1, JAK2, SF3B1, SRSF2;高适应度阈值:sT=0.226
阅读提示:Methods:Results中对基因分析;图4G-I
方差分析
变异:DNMT3A.R882H/C和JAK2.V617F;固定s=0.15进行模拟;样本量:47和46条轨迹
阅读提示:Methods:Bayesian Inference on Individual Trajectories;Results:图4G