角色提示在GPT-5肿瘤委员会模拟中调节语言风格但不改变临床决策结构

Role prompting modulates linguistic style but not clinical decision structure in GPT-5 tumour board simulation

作者信息Derna Stifini, Andrea Della Penna, André L Mihaljevic, Michael Bitzer, Carsten Eickhoff, Ivan Capobianco
PMID42595794
发布时间2026-08-13
DOI10.1038/s41746-026-03069-4

实验完整度

包含多层级验证:100例临床病例的MDT一致性评估、角色真实性分析、嵌入几何分析、熵分析及集成模型对比。

主要模型

100例胃肠道肿瘤病例(含食管、胃、胰腺、肝胆、结直肠各20例) GPT-5模型

重点核对

MDT参考标准:9类治疗类别;每个病例20例,5种肿瘤类型,10例初诊和10例随访 零样本提示框架:5种 + 集成;所有提示要求德语回复 统计检验:Cochran's Q、McNemar、点双列相关、Kruskal-Wallis、Shannon熵 嵌入模型:BAAI/bge-m3,余弦相似度、PCA、Jensen-Shannon散度

摘要

多学科肿瘤委员会(MDT)是胃肠道肿瘤决策的标准,但资源密集。尚未系统测试专科特定角色提示是否在大语言模型(LLM)中引发真正不同的临床推理,还是仅在不变输出周围产生符合角色的语言。我们对GPT-5应用了五种零样本提示框架和多数投票集成,覆盖100例经MDT验证的胃肠道肿瘤病例:模拟MDT、多专家审议、三位专科角色和多数投票集成。与MDT建议的一致性范围为78%至87%,框架间无显著差异(Cochran's Q = 8.46, p = 0.133)。专科特征语言几乎普遍存在(97–100%),但与准确性不相关。嵌入分析显示各角色间语义相似性高(余弦相似度0.805–0.836;η² = 0.049),而多专家审议下的输出分离显著更大(η² = 0.554–0.581)。GPT-5能可靠地将语言风格适应临床角色,但产生的专科特定输出多样性有限,支持其作为决策辅助工具而非自主专科模拟器的角色。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
专科特定角色提示是在LLM中引发真正不同的临床推理,还是仅产生符合角色的语言而输出不变?
核心机制
角色提示调节语言风格而非决策结构;多专家审议通过显式角色分离诱导更大的嵌入空间分离,但未提高一致性。
主要证据
100例病例中,MDT一致性范围78-87%,无显著差异;角色特定语言普遍存在但与准确性无相关性;多专家审议下嵌入分离增大(η²从0.049到0.554)但一致性未提高。
研究意义
支持LLM作为决策支持辅助工具而非自主专科模拟器;未来进展需架构多样化如多智能体系统。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

病例选择与数据匿名化

建立标准化的临床病例集,作为所有提示框架的输入。

回顾性筛选2022年3月至2023年12月MDT病例,按肿瘤类型分层,每类20例,简单随机抽样,匿名化处理。

2

提示框架设计与GPT-5运行

比较不同提示框架下GPT-5的推荐与MDT决策的一致性。

对100例病例应用五种零样本提示框架(模拟MDT、多专家审议、三个专科角色)和多数投票集成,所有输出为德语。

3

推荐分类与一致性评估

定量评估各框架与MDT参考标准的一致性。

将输出映射至9类治疗类别,计算与MDT推荐的一致性,进行统计检验。

4

角色真实性分析

评估角色提示是否产生专科特定内容和角色边界遵守。

检测输出中专科特征内容、跨学科治疗决策,并分析与一致性的相关性。

5

嵌入分析与几何评估

评估不同提示框架下角色输出的语义结构和分离程度。

使用BAAI/bge-m3生成嵌入,计算余弦相似度、PCA、Kruskal-Wallis检验、η²效应量等。

6

集成与熵分析

评估集成聚合和角色间决策多样性。

对三个专科角色输出进行多数投票,计算Shannon熵和亚组分析。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
GPT-5OpenAIgpt-5-2025-08-07
BAAI/bge-m3BAAI--

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
病例选择
纳入标准:2022年3月至2023年12月MDT呈现的胃肠道肿瘤病例,排除临床试验、混合诊断;5种肿瘤类型各20例(10初诊、10随访)
阅读提示:Methods: Study design and patient selection
模型设置
GPT-5版本gpt-5-2025-08-07,知识截止2024年9月;所有提示要求德语回答;零样本设置
阅读提示:Methods: Large language model framework
提示框架
五种零样本框架定义及多数投票规则;框架2要求三个独立推理路径后合成共识;框架3-5为单一角色
阅读提示:Methods: Large language model framework; Supplementary Section S1
结果评估
9类治疗类别映射;MDT参考标准;一致性定义为治疗类别匹配;统计检验方法
阅读提示:Methods: Treatment categorization and reference standard; Framework comparison
角色真实性分析
内容分类定义(角色特定、跨学科);边界违规定义;相关性分析方法
阅读提示:Methods: Role authenticity analysis
嵌入分析
嵌入模型BAAI/bge-m3;余弦相似度、PCA、Kruskal-Wallis检验、η²计算;非参数检验适用性
阅读提示:Methods: Semantic Embedding Analysis