基准测试大型语言模型与执业临床医生在精神病理学评估中的表现

Benchmarking large language models against practicing clinicians on psychopathological assessment

作者信息Esra Lenz, Joonas Naamanka, Wolfgang Trabert, Ronald Bottlender, Berend Malchow, Andreas Meyer-Lindenberg, Tobias Gradinger, Emanuel Schwarz
PMID42414575
发布时间2026-07-07
DOI10.1038/s41746-026-02852-7

实验完整度

包含基于模拟患者访谈的转录文本评估、临床医生视频评分、专家共识参考标准以及事后模拟分歧解决等多个独立证据层级,并进行了功能验证和机制分析。

主要模型

模拟患者访谈(抑郁症、躁狂症、精神分裂症) 108名临床医生(主要为早期职业) 10个大型语言模型 专家共识小组(3名AMDP培训师)

重点核对

LLM输入为转录文本,临床医生输入为完整音视频;需核对输入模态 AMDP定义是否在提示中提供(No-K vs. With-K) 温度参数(T0.0 vs. T0.5)需核对 多数投票设置为3次独立推理,需核对

摘要

精神病学对语言的依赖使得大型语言模型(LLM)成为精神病理学评估的自然工具,然而,来自精神病学临床访谈的结构化、逐项评估仍研究不足。在这项概念验证研究中,10个LLM对三次模拟精神病学访谈的转录文本进行了评估,覆盖了精神病学方法学与文献协会(AMDP)系统的全部100个项目,并以专家共识小组作为参考标准,与108名早期职业临床医生对完整音视频录制的评分进行了基准比较。GPT-5.1和Gemini-3-Pro-Preview在三次运行中采用多数投票并以AMDP定义作为上下文时,达到了最高准确率(0.72;处于临床医生分布的第64百分位)。GPT-5.1因其微弱优势被选中,其在各情境下的准确率分别为0.81(抑郁症)、0.76(躁狂症)和0.60(精神分裂症),而临床医生的平均准确率分别为0.79、0.68和0.58。临床医生和LLM表现出不同的错误模式:临床医生倾向于过度推断症状存在,而LLM则更保守地将项目标记为“不可评估”——这在依赖观察的项目中最为明显,但即使在文本可评估的项目中也存在(19.4% vs. 11.4%,p < 0.001)。在事后模拟的分歧解决中(2091对临床医生;35.5%的分歧),LLM和委员会认证的监督与无监督的随机临床医生选择相比,与更准确的解决结果相关(p < 0.0002)。这些概念验证发现需要在真实患者访谈、更大样本以及整合多模态输入的前瞻性研究中得到验证。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
当前LLM能否从精神病学临床访谈转录文本中可靠地提取全面的精神病理学评估,并界定其评估框架。
核心机制
临床医生和LLM采用互补的解释策略:临床医生依赖情境和非语言线索但可能过度推断,LLM更严格遵循可用文本证据和操作性定义,导致错误模式差异。
主要证据
基于10个LLM对3个模拟访谈转录的AMDP100项评估,以及108名早期职业临床医生对完整音视频的评分,以专家共识为金标准,发现GPT-5.1-MV总体准确率0.72,处于临床医生第64百分位;错误模式分析显示LLM对依赖观察项目及非依赖观察项目更频繁标记“不可评估”(63.0% vs. 0.0%;19.4% vs. 11.4%)。
研究意义
作者提出LLM在不确定性情境下可能改善临床决策,但需在前瞻性研究中进行验证,并强调转录仅方法在依赖观察项目上的局限性。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

临床访谈设计与录制

生成具有临床代表性的精神病理学访谈材料

使用经过训练的模拟患者分别扮演抑郁症、躁狂症和精神分裂症三种典型精神病理学综合征,由AMDP培训的精神科医生进行半结构化访谈并录制视频,时长24-33分钟。

2

转录文本生成与清理

为LLM评估准备转录输入

使用OpenAI Whisper large-v3模型对视频进行本地转录,并进行说话人分离,人工核对修正以确保准确性,未包含行为注释。

3

临床医生评估

建立临床医生在完整音视频条件下的评估基准

从德国三家精神病院招募108名执业临床医生,他们独立匿名观看视频,并使用AMDP手册进行纸质版AMDP评分,同时评估模拟质量。

4

专家共识金标准建立

确定用于评估临床医生和LLM准确性的参考标准

由三名AMDP手册编辑和培训师组成的专家小组分别独立审查每个视频,然后通过讨论达成一致意见,形成专家共识评分。

5

LLM评估

评估LLM基于转录文本的AMDP评估准确性

使用标准化提示词,在有无AMDP定义两种条件下,对10个LLM进行查询,要求模型对每个AMDP项目给出严重程度评分和简要临床依据,并输出结构化JSON。

6

性能比较与错误分析

比较LLM与临床医生的准确性并分析错误模式

计算LLM和临床医生对AMDP项目评分的准确率,使用百分位数、模拟检验和McNemar检验比较性能与错误模式,并进行难度分类。

7

分歧解决模拟

测试LLM或委员会认证医生监督能否提高分歧项目的准确性

从108名临床医生中随机抽取对(共2091对),当他们对项目评分不一致时,使用三种策略解决:随机选择、委员会认证医生监督、LLM监督,并比较准确性。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
Whisper large-v3OpenAI--
GPT-5.1OpenAI--
GPT-4o-miniOpenAI--
Claude-Sonnet-4.5Anthropic--
Gemini-3-Pro-PreviewGoogle--
Gemini-2.5-FlashGoogle--
Mistral-Large 3Mistral--
Qwen3-Next-80BTogether AI--
DeepSeek-R1Together AI--
Kimi-K2-ThinkingTogether AI--
GPT-OSS-20BTogether AI--

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
临床访谈
模拟患者数量:1名;访谈次数:3次(每种诊断一次);时长:24-33分钟;访谈者:AMDP培训的精神科医生;模拟患者接受约1小时临床简报,不使用脚本。
阅读提示:见Methods - Clinical interviews
转录生成
转录模型:OpenAI Whisper large-v3;是否进行说话人分离;是否人工核对转录。
阅读提示:见Methods - LLM assessment procedures
AMDP评估
使用AMDP系统第11版;评分方案:非简化(0-4级)和简化(0-2级);是否提供AMDP定义(No-K或With-K);定义批次大小。
阅读提示:见Methods - Psychopathological assessment instrument 和 LLM assessment procedures
LLM评估
模型列表;API访问方式;温度设置(0.0或0.5);多数投票次数(3次);提示词框架(GRASCEF)。
阅读提示:见Methods - LLM assessment procedures 和 Supplementary Note 1
临床医生评估
临床医生来源和数量(108名);观看视频数量(1-3个);评分时间限制(视频时长+15分钟);是否排除不完整评分(>80%未评)。
阅读提示:见Methods - Clinician assessment
金标准建立
专家小组人数(3名);是否先独立评分后讨论达成一致;每个视频讨论时长(约3小时)。
阅读提示:见Methods - Ground truth establishment
统计分析
准确率计算基于简化3级评分;置换检验的置换次数(5000);自举次数(10000);模拟合成评分者数量(50000)。
阅读提示:见Methods - Statistical Analyses