一项关于基于大语言模型的聊天机器人对心理健康伤害的范围综述

A scoping review on the mental health harms of LLM-based chatbots

作者信息Alexander Diel, John Torous, Pim Cuijpers, Jens Kleesiek, Felix Nensa, Niels Weber, Franziska Faust, Tania Josan Lalgi, Finley Sam Mellis, Martin Teufel, Alexander Bäuerle
PMID42624944
发布时间2026-08
DOI10.1038/s41746-026-03054-x

实验完整度

本文为范围综述,主要基于文献检索、分类和叙述性综合,未包含原始实验数据或具体实验方法。

摘要

基于大语言模型的聊天机器人(LLM-based chatbots)在日常生活中日益普及。尽管人们对其对心理健康的负面影响表示担忧,但尚未对基于LLM的聊天机器人潜在心理健康伤害这一日益增长领域的研究和主题进行综合。本范围综述采用基于PRISMA的系统文献检索策略,使用经过验证的检索字符串,从五个文献数据库(ACM、IEEE、PubMed、Science.gov、Google Scholar)和补充检索中识别出N = 3137篇文章,最终纳入N = 119篇文章,这些文章(1)关注基于LLM的聊天机器人,且(2)关注使用对心理健康造成的伤害。文献被分为五类。概念性文章提到了基于聊天机器人局限性(幻觉、谄媚、偏见)、数据安全问题以及严重或高风险精神病例(如自杀、精神病)风险的伤害。小场景研究显示,与临床标准相比,基于LLM的聊天机器人在回应心理健康查询时不恰当。对聊天机器人的认知过度依赖与认知和学业表现下降有关。基于LLM的聊天机器人的问题性使用(以情感或社交依赖和戒断症状为标志)与心理健康症状相关。关于AI精神病的文章提出了妄想信念与基于LLM的聊天机器人使用之间的几种潜在联系,例如聊天机器人强化和验证妄想信念的风险。这一结构化、综合性的概述表明,理论和实证工作识别出与LLM聊天机器人在心理健康中的使用相关的多种假设性和观察到的伤害。

实验结论

提炼研究问题、关键发现与证据,快速把握文章的核心贡献。

研究问题
基于LLM的聊天机器人对心理健康有哪些潜在或已观察到的伤害,其证据水平如何?
核心机制
文中未明确说明
主要证据
通过对119篇文献的系统综述,归纳出五类伤害:概念性提到的直接精神心理伤害、行为关系伤害、认知教育伤害、聊天机器人输出安全失败以及治理隐私结构性风险;小场景研究显示聊天机器人对心理健康查询回应不充分;相关性研究显示问题性使用与心理健康症状相关;AI精神病研究提出聊天机器人可能强化妄想信念。
研究意义
为未来研究提供了结构化的概述,并指出了研究空白,强调了在心理健康领域安全实施LLM聊天机器人需最小化和减轻这些伤害,例如开发安全的LLM和实施人在环监督。

研究路径

按研究推进顺序梳理实验设计、验证步骤与关键观察。

1

文献检索

识别关于LLM聊天机器人心理健康伤害的相关文献

使用经过验证的检索字符串,在ACM、IEEE、PubMed、Science.gov、Google Scholar五个数据库进行系统检索,并辅以补充检索(参考文献筛选、引文追踪、迭代搜索),共识别出3137篇文章。

2

文献筛选

筛选符合纳入标准的研究

三名独立评价者根据纳入标准(关注基于LLM的聊天机器人、关注对心理健康的伤害)对标题和摘要进行筛选,不确定者阅读全文,最终纳入119篇。

3

文献分类与证据水平评估

对纳入文献进行主题分类并评估证据水平

根据文献类型(概念/实证)和主题(心理健康支持使用、认知过度依赖、AI依赖、AI精神病)将文献分为五类,并基于设计类型评估证据水平。

4

数据提取

提取每篇文献的相关信息以进行综合

一名评价者(AD)提取数据,另两名独立评价者(NW, FF)验证和纠正。

5

数据综合与呈现

综合提取的数据以绘制研究领域图景

对纳入文献按分类总结,提出综合概念模型,评估证据水平,并识别研究空白。

研究方法

按研究目的归类文中使用的方法,便于定位所需技术。

评估文献分类
评估证据水平

关键环节

汇总复现实验时建议重点确认的条件及原文阅读提示。

环节核对要点
文献检索
检索字符串:文中未明确说明完整的检索字符串,但提供在补充信息(补充表1)中;数据库:ACM, IEEE, PubMed, Science.gov, Google Scholar;检索时间:2025年9月;Google Scholar结果数量:前500条
阅读提示:Methods下的Literature search部分,特别是Search string和Search strategy小节
文献筛选
纳入标准:1. 关注LLM-CBs;2. 关注心理健康伤害;排除标准:主要关注益处;评价者数量:3名;一致性指标:Fleiss' Kappa = 0.44
阅读提示:Methods下的Inclusion criteria和Literature selection部分
文献分类
分类类别:概念工作、心理健康支持使用、认知过度依赖、AI依赖、AI精神病;分类原则:依据文献类型和主题;分类者:3名评价者
阅读提示:Results部分的分类过程描述,以及Methods下的Data analysis and presentation部分
数据提取
提取者:1名评价者(AD);验证者:2名评价者(NW, FF);提取方法:顺序提取-验证
阅读提示:Methods下的Data extraction部分