评估大语言模型用于精神病风险评定的能力

Evaluating large language models for assessment of psychosis risk

作者信息Taiyu Zhu, Alexander Tashevski, Maxime Taquet, Matilda Azis, Tia Jani, Matthew R Broome, Thomas Kabir, Amedeo Minichino, Graham K Murray, Matthew M Nour, Ilina Singh, Paolo Fusar-Poli, Alejo Nevado-Holgado, Philip McGuire, Dominic Oliver
PMID42493532
发布时间2026-07-23
DOI10.1038/s41746-026-02928-4

实验完整度

包含多中心样本(n=373)的临床访谈转录本分析、多模型系统评估、专家评估摘要报告、公平性分析和计算性能基准测试,属于多层级验证。

主要模型

PSYCHS访谈转录本(来自AMP-SCZ队列,n=373参与者,678次评估) Llama-3.3-70B-Instruct Qwen3-Next-80B-A3B-Instruct gemma-3n-E4B-it

重点核对

模型规模(参数量)对分类性能的影响(准确率从0.599到0.802) 症状严重程度和频率评分的ICC值(ICCsev=0.74,ICCfreq=0.75) 摘要报告的置信度(93.3%完全忠实,2.7%存在影响评分的虚构) 算法公平性:跨年龄、种族、语言、性别和中心的差异 计算性能:峰值GPU内存和令牌生成速度与F1分数的权衡

摘要

精神病预防依赖于对精神病临床高风险(CHR-P)个体的早期检测。CHR-P状态的有效性在一定程度上受到限制,因为临床评估需要专家对叙述性访谈进行解读,限制了其可扩展性。在此,我们评估大语言模型(LLMs;在大型文本语料库上训练的深度学习模型,用于处理和生成语言)是否能够从此类访谈中提取具有临床意义的信息,以支持精神病风险评估。我们在来自373名参与者(77.7%为CHR-P)的678个不完整的PSYCHS访谈转录本上评估了11个开放权重的大语言模型。模型推断CHR-P状态,并估计了15个症状域的严重程度和频率,并以研究者评分为基准。较大的模型实现了最强的分类性能(Llama-3.3-70B:准确率=0.80,灵敏度=0.93,特异性=0.58)。大语言模型生成的症状评分与研究者评分显示出良好的相关性(严重程度的ICC=0.74,频率的ICC=0.75)。大多数人口统计学群体的表现差异很小,但各中心之间存在差异。生成的摘要大体上忠实于源转录本,临床上相关的虚构率较低(3%)。错误主要反映了对非临床体验的过度病理化。虽然准确性随模型大小而增加,但较小的模型以显著较低的计算成本实现了有竞争力的性能。这些发现表明,开放权重的大语言模型有潜力从心理测量访谈转录本中评估精神病风险,支持可扩展的、人在回路中的早期检测方法。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
开放权重的大语言模型能否从PSYCHS访谈转录本中准确提取临床症状信息,以支持精神病风险评估?
核心机制
利用大语言模型通过链式思考提示从访谈文本中提取症状证据,并输出结构化评分,从而评估CHR-P状态和症状严重程度/频率。
主要证据
在AMP-SCZ数据集上,使用11种LLM对678个部分转录本进行评分,其中Llama-3.3-70B表现最佳(准确率0.80,灵敏度0.93),症状评分与研究者评分相关性较高(r≈0.78-0.80)。
研究意义
该研究证明了开放权重LLM在精神病风险早期检测中的潜力,支持可扩展的、人在回路中的评估方法,可减轻临床负担并提高一致性。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

转录本预处理与分段

将PSYCHS访谈转录本分段为15个症状域,并配对研究者评分,为模型评估准备数据。

从AMP-SCZ数据集中获取678个部分转录本,经过去标识化和文本净化后,手动分段为15个症状域,共4691条转录本-域实例,并重新评估CHR-P状态。

2

LLM结构化提示评分

让LLM从每个症状域转录本中推断严重程度和频率评分,并生成基于证据的摘要。

为每个症状域构建提示,包含领域定义、评分标准、锚点描述、严格基于证据的指令和输出架构。使用链式思考提示,要求输出包含severity、frequency和summary的JSON对象。

3

输出验证与修复

确保LLM输出符合预期格式,并修复可恢复的错误,以统计评估。

对生成的JSON进行schema检查、范围检查和一致性检查。若失败,采用三阶段回退程序:搜索fenced JSON块、搜索平衡JSON、正则表达式匹配;若成功则修复,否则保留缺失值。

4

性能评估与公平性分析

评估LLM的CHR-P分类性能、症状评分的一致性、以及跨人口统计特征的公平性。

计算分类指标(准确率、灵敏度、特异性、F1等)、相关指标(Pearson r、ICC)和AUC。同时评估年龄、种族、第一语言、性别和中心的人口统计公平性。

5

专家评估摘要报告

评估LLM生成的摘要报告的质量,包括准确性、虚构和遗漏情况。

从最佳模型(Llama-3.3-70B-Instruct)的输出中随机选择10%,由两位专家(MA和DO)独立审查,对症状严重程度和频率进行评分,并评估摘要的准确度、虚构、遗漏和安全性。

6

难点案例和系统失败模式分析

识别LLM评分偏差最大的案例,了解系统性的失败模式。

根据所有模型中评分偏差的总和排名,选择15个案例,由两位专家独立审阅,通过共识会议确定失败主题。

7

计算性能基准测试

评估模型部署的硬件需求和速度,以考虑实际可行性。

在NVIDIA RTX A6000 GPU上,随机选择20个受试者,重复执行同一组提示5次,记录峰值GPU内存和令牌生成速度。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
NVIDIA A100 GPUNVIDIA--
NVIDIA RTX A6000 GPUNVIDIA--
Python 3.11.13----
PyTorch 2.8.0----
Hugging Face transformers库(v4.57.1)Hugging Face--

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
数据预处理
转录本的分段方式:根据PSYCHS访谈问题顺序手动分段为15个症状域;转录本的预处理细节:格式化和说话者轮次标准化,去除转录和编辑产生的伪影。
阅读提示:Methods:Data source and preprocessing
模型推理
模型列表、参数大小和部署环境;提示设计细节(各症状域的提示模板、评分标准、锚点描述);解码参数(温度=0,贪婪解码,批量大小=1)。
阅读提示:Methods:Model deployment and inference configuration、Structured prompting for LLM scoring
性能评估
CHR-P状态判定标准(基于症状评分和PSYCHS标准);指标计算方式:准确率、灵敏度、特异性、F1、MCC、Pearson r、ICC(A,1)和AUC。
阅读提示:Methods:Performance metrics
公平性分析
公平性分析方法:人口统计均等和均衡几率(TPR和FPR差异);人群分组:年龄(18岁以下、18岁以上)、种族(按白人为参考)、第一语言、性别和中心;bootstrap次数。
阅读提示:Methods:Performance metrics(Algorithmic fairness部分)
计算性能基准
GPU型号:NVIDIA RTX A6000;测量方法:峰值GPU内存和令牌生成速度;基准测试参数:20名受试者,5次重复。
阅读提示:Methods:Compute-performance trade-offs