机器学习预测非活动性HBsAg携带者接受聚乙二醇干扰素治疗第24周时HBsAg快速清除

Machine learning prediction of rapid HBsAg seroclearance at week 24 in inactive carriers treated with pegylated interferon

作者信息Jianxia Dong, Shan Ren, Pengxuan Wu, Haitian Yu, Xinyue Meng, Jing Zhao, Xiangyang Ye, Yan Huang, Zujiang Yu, Wenhua Zhang, Yilan Zeng, Xiaozhong Wang, Haibing Gao, Shuangsuo Dang, Jiabin Li, Sujun Zheng, Xinyue Chen
PMID41249755
发布时间2025-12
DOI10.1007/s12072-025-10936-x

实验完整度

基于多中心前瞻性队列的回顾性分析,包含模型开发与外部验证、特征选择及SHAP解释,但无干预实验,属于临床预测模型研究。

主要模型

非活动性HBsAg携带者(IHC)患者队列 外部验证队列(来自北京三个医疗中心的167例患者)

重点核对

模型预测概率阈值(Youden Index确定) 关键预测因子(第12周ALT/HBsAg比值、基线HBsAg、第12周HBsAb等) 外部验证队列的入排标准及治疗方案(Peg-IFN±NAs)

摘要

背景与目的:确定非活动性HBsAg携带者(IHC)接受聚乙二醇干扰素α-2b(Peg-IFN)治疗第24周时HBsAg快速清除的预测因素,并开发基于机器学习的模型以优化个体化治疗策略。方法:本回顾性分析基于一项多中心、前瞻性队列研究,纳入2882例接受Peg-IFN治疗并至少随访24周的IHC患者。使用LASSO回归和Boruta算法筛选第24周HBsAg清除的预测变量。开发了九种机器学习模型,包括逻辑回归(LR)、决策树(DT)和随机森林(RF),性能通过十折交叉验证评估。在来自北京三个医疗中心的独立队列(n=167)中进行了外部验证。使用SHapley Additive exPlanations(SHAP)解释模型预测和特征重要性。结果:第24周总体HBsAg清除率为18.7%(541/2,882)。关键预测因素包括基线HBsAg水平、第12周HBsAg下降≥1 log IU/mL、第12周ALT/HBsAg比值、第12周ALT与基线HBsAg比值、第12周HBV DNA水平以及第12周HBsAb水平。Light Gradient Boosting Machine(LightGBM)模型表现最佳,在训练队列中AUC为0.902(95% CI 0.881–0.923),敏感性为0.889;在外部验证队列中AUC为0.917(95% CI 0.850–0.983),敏感性为0.879。SHAP分析显示,第12周ALT/HBsAg比值是最具影响力的特征。结论:我们开发了一种基于LightGBM的机器学习模型,能够准确预测接受Peg-IFN治疗的IHC患者第24周HBsAg快速清除。该模型为早期识别快速应答者、个体化治疗计划和潜在的停药策略提供了有价值的工具。基于模型预测概率的个体化停药规则为IHC患者的精准治疗提供了循证方法。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
哪些因素可预测非活动性HBsAg携带者接受Peg-IFN治疗第24周时HBsAg快速清除,能否开发临床预测模型?
核心机制
与病毒抑制、肝细胞炎症和免疫激活相关的动态标志物(如ALT/HBsAg比值、HBsAb、HBV DNA)作为快速清除的预测因素。
主要证据
基于2882例IHC患者的队列,LightGBM模型在训练集AUC 0.902、外部验证0.917,SHAP揭示ALT/HBsAg比值最重要。
研究意义
为早期识别快速应答者、个体化治疗计划及潜在停药策略提供工具,支持精准治疗。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

队列建立与数据收集

建立包含IHC患者基线及随访数据的队列,用于模型开发与验证。

回顾性分析多中心前瞻性队列(STARHB项目)及外部验证队列,收集基线及第12周、第24周临床数据。

2

特征筛选

从众多临床变量中筛选与第24周HBsAg清除相关的预测因子。

采用LASSO回归和Boruta算法进行特征选择,结合临床可解释性,最终确定6个预测因子。

3

模型构建与评估

构建多种机器学习模型,评估其预测性能,选择最优模型。

构建9种机器学习模型,通过贝叶斯优化调参,在训练集、测试集和外部验证集评估性能,包括AUC、准确性、敏感性等。

4

模型解释

解释最优模型的预测逻辑,识别关键特征及其影响方向。

使用SHAP分析进行全局和局部解释,比较特征重要性,并展示两个代表性病例的预测分解。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
研究队列
纳入标准(HBsAg<1000 IU/mL等)、排除标准、治疗分配(Peg-IFN单药或联合NAs)、随访时间及节点
阅读提示:Materials and methods - Study population、Treatment protocol、Follow-up and data collection
特征选择
LASSO回归的λ选择(十折交叉验证,1-SE规则)、Boruta迭代次数和显著性阈值、特征稳定性bootstrap迭代次数和保留百分比
阅读提示:Materials and methods - Feature selection and collinearity control
模型训练
数据划分比例(70%/30%)、类别不平衡处理阈值(Youden Index)、超参数优化范围(如树数量、深度)、评估指标定义
阅读提示:Materials and methods - Model development、Statistical analysis
外部验证
外部验证队列的中心、样本量(n=167)、入排标准、治疗协议、随访节点
阅读提示:Materials and methods - Study population、Results - Baseline characteristics