2024年大型语言模型在心理健康领域的真实世界应用

Real-world use of large language models for mental health in 2024

作者信息Elizabeth C Stade, Zoe M Tait, Samuel T Campione, Shannon Wiltsey Stirman, Johannes C Eichstaedt
PMID42601385
发布时间2026-08-01
DOI10.1038/s41746-026-02842-9

实验完整度

该研究为横断面调查研究,包含问卷调查、心理测量和语言分析,并进行了统计学比较和主题建模,但缺少干预性实验或机制验证。

主要模型

美国成年人(Prolific在线样本,n=1871) LLM心理健康使用者(n=449)与不使用者的比较队列

重点核对

抽样平台:Prolific,配额分层抽样,按年龄、性别、种族/民族 样本量:N=2000,最终n=1871 心理障碍筛查工具:PHQ-2、GAD-2、PCL-4、Two-Item Conjoint Screen 数据分析:R、Python、DLATK、MALLET(LDA主题建模) 统计方法:Benjamini-Hochberg多重比较校正

摘要

人们在多大程度上将通用大型语言模型(LLM)用于心理健康尚属未知。使用模式的信息对于临床医生、开发者和监管者都很重要。我们在2024年8月至10月期间,采用按年龄、性别和种族/民族分层的抽样方法,对1871名美国成年人进行了调查,以近似全国人口结构。我们发现24%的参与者使用LLM来处理心理健康问题;他们多为年轻、男性、黑人,且心理健康状况较差。参与者报告难以获得传统治疗,并使用LLM,因为它们免费、方便且可获得。他们报告使用LLM来获得情感支持、学习治疗技能和补充现有治疗。利用皮尤研究中心报告的LLM使用人口估计,我们保守估计,截至2024年,可能有1400万至1800万美国成年人使用LLM来应对心理健康问题。这项工作强调需要进行监测和评估,以了解此类使用的潜在危害和益处。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
美国成年人使用大型语言模型(LLM)处理心理健康问题的普遍程度、使用模式、相关因素及潜在影响。
核心机制
文中未明确说明具体机制,但发现使用LLM的用户更多存在心理健康问题且面临传统治疗障碍,可能将LLM作为补充或替代。
主要证据
基于1871名美国成年人的调查数据,发现24%使用LLM用于心理健康,且用户更年轻、男性、黑人,并具有更高的心理障碍患病率、孤独感和治疗参与度。
研究意义
研究首次提供美国普通成年人使用LLM用于心理健康的估计,突显了监测和评估其潜在危害与益处的必要性,并为临床、开发和监管提供参考。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

抽样与调查设计

获取代表性样本并隐藏研究目的,以准确估计LLM心理健康使用率。

通过Prolific平台招募美国成年人,采用配额分层抽样,将关键问题嵌入其他LLM使用问题中以掩盖焦点。

2

心理健康与幸福感测量

比较LLM心理健康使用者和非使用者在心理病理和幸福感方面的差异。

使用超简短筛查工具评估抑郁、焦虑、PTSD和物质使用障碍,以及孤独感和生活质量。

3

治疗史与使用动机评估

了解LLM心理健康使用者的治疗背景、使用动机及面临的障碍。

通过自编二分类项目询问当前及终身的心理治疗使用、治疗获取困难及具体障碍,并询问使用LLM的原因。

4

LLM使用细节与感知评估

详细描述LLM心理健康使用的频率、模型、具体用途及用户感知。

用户完成关于使用频率、最常用模型、具体功能(如情感支持、技能学习)以及有用性、治疗联盟、喜恶的封闭式和开放式问题。

5

开放文本的主题建模分析

从开放式回答中提取用户使用LLM的具体主题和原因。

对用户的自由文本回答进行句子分词,应用LDA主题建模,并计算主题与调查问题的相关性。

6

人口估计

估算美国成年人中使用LLM应对心理健康问题的总人数。

结合样本中的LLM使用率和心理健康使用率,以及皮尤研究中心的人口估计和人口普查数据,计算范围。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

产品清单

实验环节名称品牌货号
Prolific平台----
R软件--version
Python--version
tidyverse包--version
psych包--version
nltk库--version
pandas库--version
numpy库--version
差分语言分析工具包--version
MALLET工具包----
患者健康问卷-2项----
广泛性焦虑障碍2项筛查----
创伤后应激障碍检查表-4项----
酒精和其他药物问题两项目联合筛查----
UCLA 3项孤独感量表----
生活质量享受与满意度问卷-简表----
DSM-5焦虑及相关障碍访谈计划-终身版(改编)----
寻求帮助自我污名量表----
虚拟治疗师联盟量表(改编)----

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
调查抽样
抽样平台、样本量、分层变量、目标人群
阅读提示:Methods 'Procedure'部分
心理测量
筛查工具、评分范围、诊断阈值
阅读提示:Methods 'Psychopathology and well-being measures'部分
治疗历史测量
治疗史项目来源、障碍项目具体内容
阅读提示:Methods 'Treatment history measures'部分
LLM使用评估
关键筛查问题嵌入方式、使用频率和主题选项
阅读提示:Methods 'Procedure'和'Reasons for use and topics addressed'部分
用户感知评估
有用性项目、联盟量表改编和评分范围
阅读提示:Methods 'User perception measures'部分
数据分析
统计检验、多重比较校正、主题建模参数
阅读提示:Methods 'Statistical analysis'部分