临床访谈设计与录制
生成具有临床代表性的精神病理学访谈材料
使用经过训练的模拟患者分别扮演抑郁症、躁狂症和精神分裂症三种典型精神病理学综合征,由AMDP培训的精神科医生进行半结构化访谈并录制视频,时长24-33分钟。
Benchmarking large language models against practicing clinicians on psychopathological assessment
包含基于模拟患者访谈的转录文本评估、临床医生视频评分、专家共识参考标准以及事后模拟分歧解决等多个独立证据层级,并进行了功能验证和机制分析。
模拟患者访谈(抑郁症、躁狂症、精神分裂症) 108名临床医生(主要为早期职业) 10个大型语言模型 专家共识小组(3名AMDP培训师)
LLM输入为转录文本,临床医生输入为完整音视频;需核对输入模态 AMDP定义是否在提示中提供(No-K vs. With-K) 温度参数(T0.0 vs. T0.5)需核对 多数投票设置为3次独立推理,需核对
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
生成具有临床代表性的精神病理学访谈材料
使用经过训练的模拟患者分别扮演抑郁症、躁狂症和精神分裂症三种典型精神病理学综合征,由AMDP培训的精神科医生进行半结构化访谈并录制视频,时长24-33分钟。
为LLM评估准备转录输入
使用OpenAI Whisper large-v3模型对视频进行本地转录,并进行说话人分离,人工核对修正以确保准确性,未包含行为注释。
建立临床医生在完整音视频条件下的评估基准
从德国三家精神病院招募108名执业临床医生,他们独立匿名观看视频,并使用AMDP手册进行纸质版AMDP评分,同时评估模拟质量。
确定用于评估临床医生和LLM准确性的参考标准
由三名AMDP手册编辑和培训师组成的专家小组分别独立审查每个视频,然后通过讨论达成一致意见,形成专家共识评分。
评估LLM基于转录文本的AMDP评估准确性
使用标准化提示词,在有无AMDP定义两种条件下,对10个LLM进行查询,要求模型对每个AMDP项目给出严重程度评分和简要临床依据,并输出结构化JSON。
比较LLM与临床医生的准确性并分析错误模式
计算LLM和临床医生对AMDP项目评分的准确率,使用百分位数、模拟检验和McNemar检验比较性能与错误模式,并进行难度分类。
测试LLM或委员会认证医生监督能否提高分歧项目的准确性
从108名临床医生中随机抽取对(共2091对),当他们对项目评分不一致时,使用三种策略解决:随机选择、委员会认证医生监督、LLM监督,并比较准确性。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 转录生成 | Whisper large-v3 | OpenAI | -- |
| 模型访问 | GPT-5.1 | OpenAI | -- |
| GPT-4o-mini | OpenAI | -- | |
| Claude-Sonnet-4.5 | Anthropic | -- | |
| Gemini-3-Pro-Preview | -- | ||
| Gemini-2.5-Flash | -- | ||
| Mistral-Large 3 | Mistral | -- | |
| Qwen3-Next-80B | Together AI | -- | |
| DeepSeek-R1 | Together AI | -- | |
| Kimi-K2-Thinking | Together AI | -- | |
| GPT-OSS-20B | Together AI | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 临床访谈 | 模拟患者数量:1名;访谈次数:3次(每种诊断一次);时长:24-33分钟;访谈者:AMDP培训的精神科医生;模拟患者接受约1小时临床简报,不使用脚本。 阅读提示:见Methods - Clinical interviews |
| 转录生成 | 转录模型:OpenAI Whisper large-v3;是否进行说话人分离;是否人工核对转录。 阅读提示:见Methods - LLM assessment procedures |
| AMDP评估 | 使用AMDP系统第11版;评分方案:非简化(0-4级)和简化(0-2级);是否提供AMDP定义(No-K或With-K);定义批次大小。 阅读提示:见Methods - Psychopathological assessment instrument 和 LLM assessment procedures |
| LLM评估 | 模型列表;API访问方式;温度设置(0.0或0.5);多数投票次数(3次);提示词框架(GRASCEF)。 阅读提示:见Methods - LLM assessment procedures 和 Supplementary Note 1 |
| 临床医生评估 | 临床医生来源和数量(108名);观看视频数量(1-3个);评分时间限制(视频时长+15分钟);是否排除不完整评分(>80%未评)。 阅读提示:见Methods - Clinician assessment |
| 金标准建立 | 专家小组人数(3名);是否先独立评分后讨论达成一致;每个视频讨论时长(约3小时)。 阅读提示:见Methods - Ground truth establishment |
| 统计分析 | 准确率计算基于简化3级评分;置换检验的置换次数(5000);自举次数(10000);模拟合成评分者数量(50000)。 阅读提示:见Methods - Statistical Analyses |