HealthFlow:通过战略性自演化多智能体框架自动分析电子健康记录

HealthFlow: automating electronic health record analysis via a strategically self-evolving multi-agent framework

作者信息Yinghao Zhu, Zixiang Wang, Yifan Qi, Lei Gu, Dehao Sui, Haoran Hu, Xichen Zhang, Ziyi He, Yasha Wang, Junjun He, Liantao Ma, Lequan Yu
PMID42660985
发布时间2026-08-17
DOI10.1038/s41746-026-03097-0

实验完整度

包含多智能体框架设计、消融实验、基准测试评估和人类专家评估,但缺乏传统湿实验,实验方法主要为算法和系统验证。

主要模型

EHRFlowBench基准测试(包含100个EHR分析任务) MedAgentBoard工作流任务集 MIMIC-IV公开演示数据集 TJH数据集

重点核对

EHRFlowBench任务源于51,280篇论文,经筛选后由118篇种子论文生成236个候选任务,随机抽样100个(50个TJH,50个MIMIC-IV) HealthFlow参考配置:DeepSeek-V3.2作为前后端模型,OpenCode作为执行后端,允许每个任务最多3次尝试,评估器成功阈值0.8,检索预算K=6,Ktype=2 运行时配置敏感性:前端模型DeepSeek-V3.2-Think在EHRFlowBench上达到4.08,后端模型DeepSeek-V3.2-Think在HLE上达到18.20% 消融实验:从仅有执行器的3.72提高到完整系统的4.01(EHRFlowBench),从43.94%提高到63.05%(MedAgentBoard) 人类评估:12名领域专家对20个随机选择的EHRFlowBench报告进行盲审,HealthFlow获得最多选票

摘要

电子健康记录(EHR)是真实世界临床数据的丰富来源,但将其转化为有效的分析仍然缓慢、脆弱且需要大量专家参与。尽管近期AI智能体能够回答医学问题和利用工具,但自动化完整的EHR工作流仍然困难,因为小的规划或执行错误可能使看似合理的分析失效。在此,我们提出HealthFlow,一个多智能体框架,将先前的EHR分析转化为结构化、受治理的经验,用于在数据集特定和方法学约束下进行规划。我们还引入了EHRFlowBench,一个从51,280篇同行评审论文中整理出的严格基准测试,包含EHR分析任务。在EHRFlowBench和四个已建立的基准测试(MedAgentBoard、MedAgentsBench、HLE和CureBench)上,HealthFlow在生成有效临床工件和完成复杂EHR分析管线方面持续优于强基线。这些结果表明,对先前分析经验的受治理重用提高了健康数据科学的鲁棒性,并为自动化开放式EHR分析开辟了有前景的路径。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
如何通过受治理的先前经验重用来提高自动化EHR分析的鲁棒性?
核心机制
HealthFlow通过将先前的EHR分析组织为结构化记忆(包括methodological safeguards、workflows、dataset anchors和code snippets),并在检索、更新和淘汰时施加显式约束(如任务族、数据集签名、模式标签和风险标签),从而在规划过程中纳入有效经验。
主要证据
在EHRFlowBench上,HealthFlow得分4.01,优于最强基线Biomni的3.76;在MedAgentBoard上,成功率为63.05%,比Biomni高12.95个百分点。消融研究显示,逐步添加规划器、评估器、反射器和外部工具使性能单调提升。
研究意义
作者指出,受治理的先前经验重用可提高自主EHR分析的鲁棒性,并加速数据驱动的医疗研究。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

构建EHRFlowBench基准测试

评估自主EHR分析智能体在开放式EHR工作流中的能力。

从51,280篇会议论文中筛选出118篇种子论文,每篇生成两个任务(分别基于TJH和MIMIC-IV),随机抽样100个任务,涵盖10个EHR分析类别。

2

评估HealthFlow在多个基准上的性能

比较HealthFlow与基线方法在EHR工作流、医学知识和工具使用等方面的表现。

在EHRFlowBench、MedAgentBoard、MedAgentsBench、HLE和CureBench上运行HealthFlow和多种基线方法,计算得分和成功率。

3

消融研究

隔离HealthFlow各组件(规划器、评估器、反射器、外部工具)对性能的贡献。

从仅有执行器(OpenCode)开始,逐步添加EHR感知规划器/评估器、反射器(经验综合和检索)、外部工具(OneEHR和ToolUniverse),记录每个阶段的性能。

4

运行时配置敏感性分析

评估不同前端模型、后端模型和执行后端对性能的影响。

在参考配置基础上,分别改变前端模型(DeepSeek-V3.2, DeepSeek-V3.2-Think, Qwen3.5-Flash)、后端模型(同上)和执行后端(OpenCode, Claude Code, Pi)。

5

人工评估

评估生成报告的实际实用性。

12名领域专家对20个随机选择的EHRFlowBench报告进行盲审,选择最佳响应,统计每个系统的选票份额。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
DeepSeek-V3.2----
DeepSeek-V3.2-Think----
Qwen3.5-Flash----
OpenCode--1.3.13
Claude Code--2.1.92
Pi--0.65.0
HuatuoGPT-o1----
MedGemma----
Baichuan-M2----
OneEHR----
ToolUniverse----
MIMIC-IV公开演示版----
TJH数据集----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
基准测试构建
论文筛选标准:时间范围、会议列表、LLM集成、人工审查;任务提取:每篇论文生成两个任务,分别基于TJH和MIMIC-IV;抽样:随机选择50个TJH和50个MIMIC-IV任务。
阅读提示:Methods部分 'Data sources and processing' 和 'EHRFlowBench construction'
模型配置
参考配置:DeepSeek-V3.2作为前后端模型,OpenCode作为执行后端;运行时配置:改变前端/后端模型(DeepSeek-V3.2, DeepSeek-V3.2-Think, Qwen3.5-Flash)和执行后端(OpenCode, Claude Code, Pi);执行后端版本。
阅读提示:Methods部分 'Computational infrastructure and model settings'
评估协议
成功阈值:0.8;最大尝试次数:3;检索预算:K=6,Ktype=2;评判模型:Gemini 3.1 Flash-Lite;评分方式:EHRFlowBench按1-5分制,MedAgentBoard二值成功。
阅读提示:Methods部分 'Evaluation protocol'
数据来源
MIMIC-IV Public Demo Release版本2.2;TJH数据集来源;去标识化和伦理合规。
阅读提示:Methods部分 'Data sources and processing'
人工评估
评估者资格:博士或持牌医师;报告数量:20个;评估者数量:12;盲审设置:匿名化,随机顺序。
阅读提示:Methods部分 'Evaluation protocol' 和 'Human evaluation platform'