数据集构建与质量控制
建立用于评估VLM诊断性能的内部和外部验证数据集。
从EHPN数据集筛选72例CBCT图像,从MMDental数据集筛选70例(平衡样本),由两名资深口腔颌面放射科医师独立盲审,通过共识解决分歧以确定金标准。
Vision-Language Model as a 'Zero-Shot' Assistant for Evaluating Condylar Osseous Changes in Cone-beam Computed Tomography
研究包含内部和外部验证的诊断性能评估及报告质量评估,但核心为诊断准确性和报告生成的评价,缺乏功能或机制验证实验。
EHPN数据集中的72例CBCT图像(32例异常,40例对照) MMDental数据集中70例CBCT图像(35例异常,35例正常)
内部验证样本量:72例(EHPN数据集),异常32例,对照40例 外部验证样本量:70例(MMDental数据集),异常35例,正常35例 金标准:双放射科医师共识,内部验证观察者间一致性κ=0.89,外部验证κ=0.85 推理设置:温度=0,确保确定性输出 图像处理:单张代表性矢状切面,裁剪至330×330像素
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
建立用于评估VLM诊断性能的内部和外部验证数据集。
从EHPN数据集筛选72例CBCT图像,从MMDental数据集筛选70例(平衡样本),由两名资深口腔颌面放射科医师独立盲审,通过共识解决分歧以确定金标准。
评估VLM在CBCT矢状切面上零样本检测髁突骨质改变的能力。
向每个模型展示72张内部验证图像和70张外部验证图像,使用结构化提示策略,要求模型进行系统解剖分析并给出二元诊断结论(有无骨质改变)。
评估VLM生成符合DC/TMD指南的结构化放射学报告的质量。
三个VLM针对内部验证集中32例确诊为骨质改变的病例生成报告,两名放射科医师使用QAMAI框架(1-5分)对报告进行独立评估,评估时使用Python Gradio评分界面以盲法隐藏模型身份。
比较三个VLM的诊断性能和报告质量差异。
计算诊断性能指标及95%置信区间(Wilson score法),使用McNemar检验进行配对比较,使用Friedman检验比较QAMAI评分,必要时进行Wilcoxon符号秩检验和Bonferroni校正。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 数据获取 | 3D Accuitomo 170 | J. Morita | -- |
| 图像处理 | 3D Slicer v5.10.0 | -- | -- |
| 模型推理 | OpenRouter平台 | OpenRouter | -- |
| Gemini-3 Pro预览版 | OpenRouter | google/gemini-3-pro-preview | |
| GPT-5.2 | OpenRouter | openai/gpt-5.2 | |
| Qwen3-VL-235b-a22b-thinking | OpenRouter | qwen/qwen3-vl-235b-a22b-thinking | |
| 报告评估 | Python Gradio评分界面 | -- | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据集 | 内部验证数据集来源(EHPN)和外部验证数据集来源(MMDental);样本量(内部72例,外部70例);异常与正常比例(内部32:40,外部35:35) 阅读提示:Methods部分(数据集描述和筛选过程) |
| 图像选择 | 每例选择单张代表性矢状切面,裁剪至330×330像素;单侧病变选患侧,双侧病变选改变最明显侧 阅读提示:Methods部分(图像选择和预处理) |
| 金标准 | 由两名资深放射科医师独立盲审,内部验证一致性κ=0.89,外部验证κ=0.85,分歧通过共识解决 阅读提示:Methods部分(金标准确定) |
| 模型推理 | 三个VLM(Gemini-3、GPT-5.2、Qwen3-VL);温度设置为0;使用相同的提示(见补充材料1) 阅读提示:Methods部分(模型选择和实验设计) |
| 报告评估 | 仅对内部验证集中的32例异常病例进行评估;使用QAMAI框架;两名放射科医师盲法评分 阅读提示:Methods部分(任务2:标准化报告生成) |