遵循医学人工智能建议如何减轻医疗事故责任:来自随机试验的跨国见解

How Following Medical Artificial Intelligence Advice Can Mitigate Malpractice Liability: Cross-National Insights from a Randomized Trial

作者信息Alessandro Tacconelli, Jakob Merane, Aileen Nielsen, Kevin Tobia, Björn Hackanson, Alexander Stremitzer
PMID42242875
发布时间2026-09
DOI10.2967/jnumed.126.272292

实验完整度

采用随机2×2析因情景实验,覆盖美国外行、德国医生和德国外行三种样本,包含统计分析及等价性检验,形成了高水平的实验完整度。

主要模型

美国成年人样本 德国医生样本 德国成年人样本

重点核对

样本来源:美国外行来自Cint商业小组,德国医生来自四家学术医院 样本量:美国外行1202人、德国医生248人、德国外行1358人 分组:2×2析因设计,随机分配至4种情景 主要结局:合理性评分(7点李克特量表)

摘要

人工智能(AI)日益影响临床决策,然而其建议可能与标准医疗相悖。尽管人们认为医疗事故担忧会阻止医生遵循AI建议,但来自美国的实验证据表明情况恰恰相反:非专业陪审员在医生拒绝AI建议时更可能判定医生承担责任。这一模式是否适用于由法院指定的专家而非非专业陪审员来判定责任的法律体系,仍是未知数。方法:为了研究基于专家与基于非专业陪审员的法律体系中的医生和外行如何评价医生接受或拒绝AI建议的行为,尤其是在这些建议偏离标准医疗的情况下,我们设计了一项随机情景研究:采用2×2析因设计,改变AI建议(标准与非标准医疗)和虚构医生的决策(接受与拒绝)。该研究于2023年在美国和德国具有全国代表性的成年人样本中在线进行,并于2023年至2024年在德国医生中开展。共有387名德国医生、2291名美国成年人和2283名德国成年人参与;根据预先登记的标准,未完成调查或未通过注意力检查者被排除。参与者被随机分配到4个情景之一,情景改变了AI建议(标准与非标准医疗)和医生的决策(接受与拒绝)。测量了虚构医生决策的合理性,由参与者在李克特量表上评分。结果:按照预先登记的排除标准,分析纳入248名德国医生、1202名美国成年人和1358名德国成年人。接受标准医疗AI建议的医生比拒绝建议的医生被评价为更合理(美国外行:t = 5.36;95% CI,0.45–0.97;P < 0.001;德国医生:t = 2.47;95% CI,0.14–1.30;P = 0.02;德国外行:t = 4.14;95% CI,0.27–0.76;P < 0.001)。对接受与拒绝非标准医疗AI建议的医生的评分在统计上等价。等价性检验在α值为0.05时使用双单侧检验程序进行,按照标准惯例报告90%置信区间(美国外行:t = –4.90;90% CI,–0.1至0.36;P < 0.001;德国医生:t = –1.76;90% CI,–0.12至0.67;P = 0.04;德国外行:t = 5.35;90% CI,–0.35至0.06;P < 0.001)。结论:在美国和德国,代表非专业陪审员和法院指定专家的样本认为接受标准医疗AI建议更为合理,而接受或拒绝非标准医疗AI建议的评价相似。与预测相反,医疗事故责任制度不一定构成AI在精准医学中使用的障碍。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
医生接受或拒绝医疗AI建议时,如何在不同法律体系下影响其责任的判定?
核心机制
责任判断遵循“同时跟随AI和标准医疗”模型:接受标准医疗AI建议被视作更合理,而接受或拒绝非标准AI建议的评价无显著差异。
主要证据
一项在线随机情景实验,包含美国外行、德国医生和德国外行样本,使用2×2析因设计,通过方差分析和等价性检验评估合理性评分。
研究意义
研究提示医疗事故责任制度不必然构成AI在精准医学中使用的障碍,且跨法律体系(陪审制和专家制)结果一致。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

建立法律与医学责任模型

提出并预测医生接受或拒绝AI建议时责任判断的可能模式

基于已有文献提出四种责任模型(Follow AI、Follow Standard Care、Follow Both、Discretionary),并设计2×2析因实验进行检验。

2

设计随机情景实验

评估医生在AI建议与标准医疗一致或不一致时接受或拒绝的合理性评价

参与者被随机分配到4种情景之一,情景描述卵巢癌患者Ella的案例,涉及标准化疗剂量或非标准剂量,并固定不良结局;参与者对医生决策的合理性进行7点李克特评分。

3

实施问卷调查

收集参与者的合理性评分及背景信息

通过Qualtrics平台在线发放问卷,参与者阅读情景后评分,并回答关于人口统计学、对AI的态度以及法律和医学领域接触情况。

4

进行统计分析

检验不同条件下合理性评分的差异及模型拟合

使用2×2方差分析、事后配对t检验,并针对空结果进行双单侧检验以评估等价性,并进行稳健性分析。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
Qualtrics平台----
R软件,版本4.4.2R Project for Statistical Computing--
G*Power----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
样本招募
美国外行通过Cint招募,德国医生来自四所学术医院,德国外行招募方式未明确说明;样本量需核对。
阅读提示:见Methods中的Participants部分及CONSORT流程图
实验设计
2×2析因设计,情景内容(AI建议标准或非标准剂量,医生接受或拒绝),随机分配方式需确认。
阅读提示:见Methods中的Experimental Design部分
结局测量
合理性评分采用7点李克特量表,具体陈述需核对。
阅读提示:见Methods中的Outcome Variable部分