数据集构建
获取德语和俄语样本,包括精神病患者、健康对照,以及俄语样本中的抑郁临床对照,用于评估指标跨语言性能。
德语样本包含59名精神病患者(DSM-IV-TR诊断)和20名对照,使用Narrative of Emotions Task访谈;俄语样本包含31名精神病患者(ICD-10诊断)、30名对照和18名抑郁患者,使用四个不同诱发任务(图片、指令、个人故事)。
Cross-linguistic benchmarking of NLP metrics for psychosis research
本研究为基准测试研究,缺乏功能性实验验证,主要依赖统计分析(t检验、相关性、ROC-AUC等),未涉及机制验证或生物学实验。
德语样本(59名精神病患者,20名健康对照) 俄语样本(31名精神病患者,30名对照,18名抑郁患者)
精神病诊断标准:德语样本采用DSM-IV-TR,俄语样本采用ICD-10 症状严重度评估:德语样本使用PANSS,俄语样本使用PANSS和Hamilton抑郁量表 言语诱发任务:德语样本包含四个情绪访谈,俄语样本包含四个不同任务(图片描述、指令、个人故事) 统计分析:使用t检验、Pearson相关、ROC-AUC、ΔR²,并采用自举法(1000次)估计置信区间 控制变量:模型包含年龄、性别、教育年限和言语智商(仅德语样本)
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
获取德语和俄语样本,包括精神病患者、健康对照,以及俄语样本中的抑郁临床对照,用于评估指标跨语言性能。
德语样本包含59名精神病患者(DSM-IV-TR诊断)和20名对照,使用Narrative of Emotions Task访谈;俄语样本包含31名精神病患者(ICD-10诊断)、30名对照和18名抑郁患者,使用四个不同诱发任务(图片、指令、个人故事)。
标准化文本数据,以消除转录差异对指标性能的影响。
手动转录语音,去除访谈者语音和填充性停顿,进行句子分割、自动分词和词形还原(使用SpaCy模型:德语de_core_news_md和俄语ru_core_news_md)。
计算51种常用NLP指标,包括词汇、句法、图基和语言模型指标,以及三个言语量基线。
基于文献综述选择指标,计算词数、句子长度、部分词性频率、词元-标记比、图基指标(节点/边数,连通分量大小等)、语言模型指标(word2vec、GloVe、BERT)等。
评估每个指标的区分能力、症状严重度相关性和稳健性。
使用t检验和ROC-AUC评估组间区分;使用Pearson相关评估症状严重度相关性;使用变异系数评估跨任务稳健性;计算ΔR²评估言语量之外的增量值。
评估指标性能的跨任务一致性以及是否对精神病特异性敏感。
计算性能变异系数,比较不同任务间变化;在俄语样本中比较对照、精神病和抑郁组,分析指标特异性。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 文本预处理 | SpaCy 德语句法分析模型 | SpaCy | -- |
| SpaCy 俄语句法分析模型 | SpaCy | -- | |
| 症状评估 | 阳性与阴性症状量表 | -- | -- |
| 汉密尔顿抑郁量表 | -- | -- | |
| 阴性症状评估量表 | -- | -- | |
| 阳性症状评估量表 | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据集构建 | 样本量、诊断标准、症状量表、言语IQ评估 阅读提示:Methods 中的 'Datasets' 和 Table 2 |
| 言语诱发任务 | 任务类型和具体实施细节 阅读提示:Methods 中的 'Datasets' 和 Figure 1 |
| 文本预处理 | 转录规则、句子分割指南、使用的模型 阅读提示:Methods 中的 'Preprocessing' |
| 指标计算 | 指标定义、图基指标的参数(移动窗口、词元化)、语言模型选择 阅读提示:Methods 中的 'Metric selection' 和 'Supplementary Tables 1-10' |
| 统计分析 | 统计方法、自举次数、模型协变量、ΔR²计算方法 阅读提示:Methods 中的 'Analysis' |