构建EHRFlowBench基准测试
评估自主EHR分析智能体在开放式EHR工作流中的能力。
从51,280篇会议论文中筛选出118篇种子论文,每篇生成两个任务(分别基于TJH和MIMIC-IV),随机抽样100个任务,涵盖10个EHR分析类别。
HealthFlow: automating electronic health record analysis via a strategically self-evolving multi-agent framework
包含多智能体框架设计、消融实验、基准测试评估和人类专家评估,但缺乏传统湿实验,实验方法主要为算法和系统验证。
EHRFlowBench基准测试(包含100个EHR分析任务) MedAgentBoard工作流任务集 MIMIC-IV公开演示数据集 TJH数据集
EHRFlowBench任务源于51,280篇论文,经筛选后由118篇种子论文生成236个候选任务,随机抽样100个(50个TJH,50个MIMIC-IV) HealthFlow参考配置:DeepSeek-V3.2作为前后端模型,OpenCode作为执行后端,允许每个任务最多3次尝试,评估器成功阈值0.8,检索预算K=6,Ktype=2 运行时配置敏感性:前端模型DeepSeek-V3.2-Think在EHRFlowBench上达到4.08,后端模型DeepSeek-V3.2-Think在HLE上达到18.20% 消融实验:从仅有执行器的3.72提高到完整系统的4.01(EHRFlowBench),从43.94%提高到63.05%(MedAgentBoard) 人类评估:12名领域专家对20个随机选择的EHRFlowBench报告进行盲审,HealthFlow获得最多选票
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
评估自主EHR分析智能体在开放式EHR工作流中的能力。
从51,280篇会议论文中筛选出118篇种子论文,每篇生成两个任务(分别基于TJH和MIMIC-IV),随机抽样100个任务,涵盖10个EHR分析类别。
比较HealthFlow与基线方法在EHR工作流、医学知识和工具使用等方面的表现。
在EHRFlowBench、MedAgentBoard、MedAgentsBench、HLE和CureBench上运行HealthFlow和多种基线方法,计算得分和成功率。
隔离HealthFlow各组件(规划器、评估器、反射器、外部工具)对性能的贡献。
从仅有执行器(OpenCode)开始,逐步添加EHR感知规划器/评估器、反射器(经验综合和检索)、外部工具(OneEHR和ToolUniverse),记录每个阶段的性能。
评估不同前端模型、后端模型和执行后端对性能的影响。
在参考配置基础上,分别改变前端模型(DeepSeek-V3.2, DeepSeek-V3.2-Think, Qwen3.5-Flash)、后端模型(同上)和执行后端(OpenCode, Claude Code, Pi)。
评估生成报告的实际实用性。
12名领域专家对20个随机选择的EHRFlowBench报告进行盲审,选择最佳响应,统计每个系统的选票份额。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 模型推理 | DeepSeek-V3.2 | -- | -- |
| DeepSeek-V3.2-Think | -- | -- | |
| Qwen3.5-Flash | -- | -- | |
| 执行后端 | OpenCode | -- | 1.3.13 |
| Claude Code | -- | 2.1.92 | |
| Pi | -- | 0.65.0 | |
| 本地部署 | HuatuoGPT-o1 | -- | -- |
| MedGemma | -- | -- | |
| Baichuan-M2 | -- | -- | |
| 外部工具 | OneEHR | -- | -- |
| ToolUniverse | -- | -- | |
| 数据集 | MIMIC-IV公开演示版 | -- | -- |
| TJH数据集 | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 基准测试构建 | 论文筛选标准:时间范围、会议列表、LLM集成、人工审查;任务提取:每篇论文生成两个任务,分别基于TJH和MIMIC-IV;抽样:随机选择50个TJH和50个MIMIC-IV任务。 阅读提示:Methods部分 'Data sources and processing' 和 'EHRFlowBench construction' |
| 模型配置 | 参考配置:DeepSeek-V3.2作为前后端模型,OpenCode作为执行后端;运行时配置:改变前端/后端模型(DeepSeek-V3.2, DeepSeek-V3.2-Think, Qwen3.5-Flash)和执行后端(OpenCode, Claude Code, Pi);执行后端版本。 阅读提示:Methods部分 'Computational infrastructure and model settings' |
| 评估协议 | 成功阈值:0.8;最大尝试次数:3;检索预算:K=6,Ktype=2;评判模型:Gemini 3.1 Flash-Lite;评分方式:EHRFlowBench按1-5分制,MedAgentBoard二值成功。 阅读提示:Methods部分 'Evaluation protocol' |
| 数据来源 | MIMIC-IV Public Demo Release版本2.2;TJH数据集来源;去标识化和伦理合规。 阅读提示:Methods部分 'Data sources and processing' |
| 人工评估 | 评估者资格:博士或持牌医师;报告数量:20个;评估者数量:12;盲审设置:匿名化,随机顺序。 阅读提示:Methods部分 'Evaluation protocol' 和 'Human evaluation platform' |