评估大语言模型在精神病风险评估中的应用

Evaluating large language models for assessment of psychosis risk

作者信息Taiyu Zhu, Alexander Tashevski, Maxime Taquet, Matilda Azis, Tia Jani, Matthew R Broome, Thomas Kabir, Amedeo Minichino, Graham K Murray, Matthew M Nour, Ilina Singh, Paolo Fusar-Poli, Alejo Nevado-Holgado, Philip McGuire, Dominic Oliver
PMID42493532
发布时间2026-07-23
DOI10.1038/s41746-026-02928-4

摘要

精神病的预防依赖于对处于临床高风险状态(CHR-P)个体的早期识别。CHR-P状态的有效性部分受限,因为临床评估需要专家对叙事性访谈进行专业解读,限制了可扩展性。本研究评估大语言模型(LLMs;基于大型文本语料库训练、用于处理和生成语言的深度学习模型)能否从此类访谈中提取具有临床意义的信息,以支持精神病风险评估。我们在373名参与者(77.7%为CHR-P)的678份PSYCHS访谈部分转录本上评估了11种开源权重的LLMs。模型推断CHR-P状态并估计了15个症状领域的严重性和频率,并与研究者评分进行基准比较。更大的模型实现了最强的分类性能(Llama-3.3-70B:准确度=0.80,灵敏度=0.93,特异度=0.58)。LLM生成的症状评分与研究者评分显示出良好的相关性(ICCsev = 0.74, ICCfreq = 0.75)。在大多数人口学群体中,性能差异很小,但在不同研究地点间存在差异。生成的摘要大多忠实于原始转录本,临床相关虚构率较低(3%)。错误主要反映了对非临床体验的过度病理化。虽然准确度随模型规模扩大而提高,但较小的模型以显著更低的计算成本实现了有竞争力的性能。这些发现表明,开源权重的LLMs有潜力从心理测量学访谈转录本中评估精神病风险,支持可扩展的、人在回路的早期检测方法。

实验方法

产品清单

名称品牌货号
液相色谱-质谱联用系统Thermo Fisher ScientificTSQ Quantis
液相色谱-质谱联用系统Thermo Fisher ScientificTSQ Quantiva
高效液相色谱系统Agilent1260
离心机Eppendorf5804R
移液器Eppendorf--
培养箱Thermo Fisher Scientific--
英伟达A100图形处理器NVIDIA--
英伟达RTX A6000图形处理器NVIDIA--