基于病例接地AI智能体的血液系统恶性肿瘤临床决策支持

Clinical decision support in hematological malignancies using a case-grounded AI agent

作者信息Julian Zoller, Michael Kalz, Xuewei Wu, Sven Cuntz, Linus Kruk, Niklas Kehl, Julius J Michel, Cornelius Funk, Sarah Richter, Tobias Tix, David Sedloev, Jonathan Naboschni, Jan H Frenking, Silvia Barbosa, Oliver L Saldanha, Alanna Kirschner, Anna D Metzler, Antonia Schach, René Onken, Tim R Wagner, Martin Dugas, Andreas Trumpp, Martin Dreyling, Michael von Bergwelt-Baildon, Kai Rejeski, Tim Sauer, Peter Dreger, Marc S Raab, Carsten Müller-Tidow, Jakob N Kather, Mirco J Friedrich
PMID42380678
期刊Nat Med
发布时间2026-09
DOI10.1038/s41591-026-04494-4

实验完整度

高

包含回顾性基准、消融、外部验证和前瞻性静默试验等多层证据,并有功能与分子机制验证。

主要模型

45例高复杂度血液肿瘤去标识化病例 555例慕尼黑大学医院独立肿瘤委员会病例 64例连续未选择前瞻性静默试验病例 70个单核苷酸错义变异

重点核对

六种LLM(gpt-5-mini、gpt-5-nano、gpt-oss-120b、gpt-oss-20b、qwen3-next-80b、qwen3-32b)在45例病例上的盲法专家评分 11层消融研究(L0–L10)在15例病例上的独立双评分(Cohen’s κ=0.849) 70个变异与ClinGen/CGC/VICC参考分类比较(敏感度0.88,特异度0.84) 外部验证555例病例,一致性81.8%(κ=0.934) 前瞻性静默试验64例连续病例,一致性82.8%(κ=0.795)

摘要

多学科肿瘤委员会整合纵向治疗史、分子谱和快速演变的证据来指导血液系统恶性肿瘤的决策,然而这种亚专科审议的可及性日益不均。在此,我们开发了HemaGuide,一种可本地部署的模块化大语言模型智能体,可将非结构化临床文档转换为结构化病例表示,自主将病例路由至专业决策模式(“指南”、“进阶”和“分子”),并将建议建立在疾病特异性指南流程图和包含>2,000例真实世界肿瘤委员会病例的临床决策记忆之上。在针对六种基础模型的45例高复杂度病例的专家盲法基准测试中,HemaGuide大幅提高了与肿瘤委员会决策的一致性。跨11个层面的系统消融研究证实,性能增益依赖于路由类型,没有单一组件足以应对所有病例类型。对70个临床相关错义变异的自动分类显示与专家标准高度一致;没有致癌变异被降级为良性,整个工作流程在商品硬件上实时条件下完成,中位延迟为39秒,而非手动分子委员会工作流程通常所需的数小时。在一项模拟实践研究中,智能体辅助的住院医师达到了接近高年资医师的一致性,在其亚专科领域部分表现优于高年资医师。对来自第二家学术中心的555例独立病例进行外部验证,在47个实体中获得了81.8%的一致性,对64例连续、未选择病例进行为期1个月的前瞻性静默试验达到了82.8%的一致性。幻觉发生在664例评估病例中的2例(0.3%)。这些数据共同提供了证据,表明可本地部署、基于病例接地的大语言模型智能体可以在血液系统恶性肿瘤中提供可审计的临床决策支持,其一致性在跨机构和商品硬件实时条件下得以维持。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
可本地部署、基于病例接地的大语言模型智能体能否在血液系统恶性肿瘤中提供与肿瘤委员会决策高度一致的临床决策支持,并在跨机构和实时条件下保持可靠性?
核心机制
通过将非结构化临床文档转化为结构化病例表示,并基于指南流程图、临床病例记忆和分子解读工具进行检索优先、工具约束的推理,自主路由至指南、进阶或分子模式,从而生成可审计的治疗建议。
主要证据
在45例高复杂度病例上,HemaGuide嵌入的gpt-oss-120b平均专家评分4.22±0.063,显著高于纯模型3.21±0.39(P=0.0015);消融研究显示全智能体一致性86.7%,而纯LLM为0%;外部验证555例一致性81.8%;前瞻性静默试验64例一致性82.8%;幻觉率0.3%。
研究意义
这些数据表明,基于病例接地的本地可部署大语言模型智能体能够在血液系统恶性肿瘤中提供可审计的临床决策支持,一致性在跨机构和商品硬件实时条件下得以维持,为在常规会前准备中补充专家肿瘤委员会审议提供了实用路径。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

构建临床病例记忆与指南知识库

建立基于真实世界病例和指南流程图的接地知识基础

从Heidelberg大学医院BRAIN数据库获取>2,000例肿瘤委员会病例,构建ChromaDB向量存储;编码疾病特异性指南流程图为文本文件;收集分子解读工具所需证据。

2

临床文档结构化提取与富集

将非结构化临床文档转化为结构化JSON病例表示,并优化用于检索和注意力分配

对.docx文档进行两阶段提取:实体分类(67个实体)和临床字段提取(九字段模式)及分子附录提取;随后进行三阶段富集:问题扩展、肿瘤委员会类型分类和决策扩展。

3

自主路由至决策模式

根据病例特征选择最合适的决策工具(指南、进阶或分子模式)

基于实体加载对应数据,评估复杂性,选择决策模式;分子肿瘤委员会咨询自动路由至分子模式;非分子病例通过路由调用选择。

4

指南模式执行

为符合既定早期治疗算法的病例提供基于方案的决策支持

检索实体特异性治疗流程图,嵌入LLM上下文,生成推荐并记录遍历的流程图节点。

5

进阶模式执行

为超出指南覆盖范围的病例整合多源证据合成建议

从临床病例记忆检索相似病例(n=2,过检索因子3,阈值0.7),进行PubMed和Crossref文献检索,LLM合成证据,生成最终推荐。

6

分子模式执行

根据ClinGen/CGC/VICC标准自动化体细胞变异分类并生成精准肿瘤推荐

通过Ensembl VEP REST API将HGVS转换为基因组坐标;查询gnomAD v4、cancerhotspots.org、COSMIC、UniProt、MyVariant.info等数据库;评估12项证据标准;对致癌或可能致癌变异触发PubMed检索;生成分子报告。

7

上下文聚合与透明推理

将所有上下文元素聚合为结构化提示,生成最终治疗推荐并记录审计轨迹

生成“决策”、“理由”和分子模式的“分子报告”;记录工具调用、检索病例和相似度分数。

8

专家盲法基准测试与消融研究

量化架构组件对决策质量的影响并比较HemaGuide与纯LLM

在45例高复杂度病例上,六种LLM以纯模型或HemaGuide嵌入式运行,四名住院医师盲法评分六个5点Likert维度;在15例病例上进行11层消融(L0–L10),两名血液学家独立评分。

9

外部验证与前瞻性静默试验

评估HemaGuide在独立队列和真实世界连续病例中的泛化性和实时一致性

外部验证:555例LMU Munich病例,TBCS评分;前瞻性静默试验:64例连续病例,HemaGuide在会议前1天生成推荐,会议次日决策,TBCS比较。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
Ollama----
ChromaDB----
embeddinggemma:300mOllama--
text-embedding-3-largeOpenAI--
Ensembl变异效应预测器REST APIEnsembl--
gnomAD v4----
cancerhotspots.org----
癌症体细胞突变目录----
UniProt----
MyVariant.info----
PubMed----
Crossref API----
Apple M3 UltraApple--

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
临床病例记忆构建
病例来源、纳排标准、实体分布、匿名化方法、向量存储配置
阅读提示:Methods‘Knowledge-base architecture for clinical case memory’和‘Clinical datasets’小节
结构化提取与富集
提取模式、实体列表、LLM调用参数(温度0.1)、富集三阶段提示
阅读提示:Methods‘Preprocessing and information extraction from clinical documents’和‘Agent orchestration for contextual enrichment’小节
自主路由
路由决策标准、分子病例自动路由条件、回退机制
阅读提示:Methods‘Agent orchestration for agentic routing’小节
指南模式
流程图来源、版本控制、生成温度、输出格式
阅读提示:Methods‘Agent orchestration of guideline mode’小节
进阶模式
相似病例检索参数(n=2,过检索因子3,阈值0.7)、PubMed和Crossref查询构建、合成提示
阅读提示:Methods‘Agent orchestration of advanced mode’小节
分子模式
数据库列表、12项证据标准、评分规则、文献检索触发条件
阅读提示:Methods‘Agent orchestration of molecular mode’小节
专家基准测试
病例选择标准、评分维度(Q1–Q6)、评估者盲法、运行次数(3次)
阅读提示:Methods‘Human evaluation and benchmarking’小节和Supplementary Table 4
消融研究
11层配置定义、病例子集(15例)、评分维度、评估者间可靠性
阅读提示:Methods‘Ablation study’小节和Supplementary Table 5
外部验证
病例来源(LMU Munich)、排除标准、实体分布、TBCS评分、评估者间可靠性
阅读提示:Methods‘Large-scale validation’小节和Supplementary Table 8
前瞻性静默试验
试验持续时间(1个月)、病例纳入标准、排除标准、TBCS评分、评估者间可靠性
阅读提示:Methods‘Silent trial’小节和Supplementary Table 9