转录本预处理与分段
将PSYCHS访谈转录本分段为15个症状域,并配对研究者评分,为模型评估准备数据。
从AMP-SCZ数据集中获取678个部分转录本,经过去标识化和文本净化后,手动分段为15个症状域,共4691条转录本-域实例,并重新评估CHR-P状态。
Evaluating large language models for assessment of psychosis risk
包含多中心样本(n=373)的临床访谈转录本分析、多模型系统评估、专家评估摘要报告、公平性分析和计算性能基准测试,属于多层级验证。
PSYCHS访谈转录本(来自AMP-SCZ队列,n=373参与者,678次评估) Llama-3.3-70B-Instruct Qwen3-Next-80B-A3B-Instruct gemma-3n-E4B-it
模型规模(参数量)对分类性能的影响(准确率从0.599到0.802) 症状严重程度和频率评分的ICC值(ICCsev=0.74,ICCfreq=0.75) 摘要报告的置信度(93.3%完全忠实,2.7%存在影响评分的虚构) 算法公平性:跨年龄、种族、语言、性别和中心的差异 计算性能:峰值GPU内存和令牌生成速度与F1分数的权衡
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
将PSYCHS访谈转录本分段为15个症状域,并配对研究者评分,为模型评估准备数据。
从AMP-SCZ数据集中获取678个部分转录本,经过去标识化和文本净化后,手动分段为15个症状域,共4691条转录本-域实例,并重新评估CHR-P状态。
让LLM从每个症状域转录本中推断严重程度和频率评分,并生成基于证据的摘要。
为每个症状域构建提示,包含领域定义、评分标准、锚点描述、严格基于证据的指令和输出架构。使用链式思考提示,要求输出包含severity、frequency和summary的JSON对象。
确保LLM输出符合预期格式,并修复可恢复的错误,以统计评估。
对生成的JSON进行schema检查、范围检查和一致性检查。若失败,采用三阶段回退程序:搜索fenced JSON块、搜索平衡JSON、正则表达式匹配;若成功则修复,否则保留缺失值。
评估LLM的CHR-P分类性能、症状评分的一致性、以及跨人口统计特征的公平性。
计算分类指标(准确率、灵敏度、特异性、F1等)、相关指标(Pearson r、ICC)和AUC。同时评估年龄、种族、第一语言、性别和中心的人口统计公平性。
评估LLM生成的摘要报告的质量,包括准确性、虚构和遗漏情况。
从最佳模型(Llama-3.3-70B-Instruct)的输出中随机选择10%,由两位专家(MA和DO)独立审查,对症状严重程度和频率进行评分,并评估摘要的准确度、虚构、遗漏和安全性。
识别LLM评分偏差最大的案例,了解系统性的失败模式。
根据所有模型中评分偏差的总和排名,选择15个案例,由两位专家独立审阅,通过共识会议确定失败主题。
评估模型部署的硬件需求和速度,以考虑实际可行性。
在NVIDIA RTX A6000 GPU上,随机选择20个受试者,重复执行同一组提示5次,记录峰值GPU内存和令牌生成速度。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 模型部署 | NVIDIA A100 GPU | NVIDIA | -- |
| NVIDIA RTX A6000 GPU | NVIDIA | -- | |
| 模型推理 | Python 3.11.13 | -- | -- |
| PyTorch 2.8.0 | -- | -- | |
| Hugging Face transformers库(v4.57.1) | Hugging Face | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据预处理 | 转录本的分段方式:根据PSYCHS访谈问题顺序手动分段为15个症状域;转录本的预处理细节:格式化和说话者轮次标准化,去除转录和编辑产生的伪影。 阅读提示:Methods:Data source and preprocessing |
| 模型推理 | 模型列表、参数大小和部署环境;提示设计细节(各症状域的提示模板、评分标准、锚点描述);解码参数(温度=0,贪婪解码,批量大小=1)。 阅读提示:Methods:Model deployment and inference configuration、Structured prompting for LLM scoring |
| 性能评估 | CHR-P状态判定标准(基于症状评分和PSYCHS标准);指标计算方式:准确率、灵敏度、特异性、F1、MCC、Pearson r、ICC(A,1)和AUC。 阅读提示:Methods:Performance metrics |
| 公平性分析 | 公平性分析方法:人口统计均等和均衡几率(TPR和FPR差异);人群分组:年龄(18岁以下、18岁以上)、种族(按白人为参考)、第一语言、性别和中心;bootstrap次数。 阅读提示:Methods:Performance metrics(Algorithmic fairness部分) |
| 计算性能基准 | GPU型号:NVIDIA RTX A6000;测量方法:峰值GPU内存和令牌生成速度;基准测试参数:20名受试者,5次重复。 阅读提示:Methods:Compute-performance trade-offs |