数据收集与注释
获取手术视频并建立标准手势标签
使用294个RARP-NS视频,由训练有素的人类评估者根据既定的分离手势分类法进行注释。
End to end AI system for surgical gesture sequence recognition and clinical outcome prediction
包含模型开发、数据缩放实验和临床结局预测分析,但缺乏体外或动物实验验证。
294个RARP保留神经步骤视频 138例患者队列
294个视频来自4个国际中心,23位外科医生 训练/验证/测试比为80/10/10 使用SSv2预训练权重 罚值0.5用于变点检测 使用5折交叉验证评估结局预测模型
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
获取手术视频并建立标准手势标签
使用294个RARP-NS视频,由训练有素的人类评估者根据既定的分离手势分类法进行注释。
开发并验证帧级手势分类模型
使用TimeSformer-HR骨干网络,结合帧级分类器,在80/10/10的数据划分上训练,评估帧级和视频级AUC。
将帧级预测转换为连续手势序列
应用训练好的模型到全视频,使用滑动窗口预测,并通过变点检测算法聚合帧级概率为分段手势序列。
从手势序列中提取特征并预测临床结局
从预测和真实手势序列中提取2484个特征,使用表格Transformer模型进行5折交叉验证预测EF恢复。
评估F2O特征与人工注释特征的一致性
对每个特征进行t检验,比较F2O和人工注释特征的效应量方向和相关。
评估模型在不同骨干网络和数据规模下的性能
使用VideoMAE V2、TimeSformer和ViViT骨干网络进行对比实验,并训练不同数据子集(10%、25%、50%、75%、100%)评估性能。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 模型训练与推理 | NVIDIA L40S GPU | NVIDIA | -- |
| A100 GPU | NVIDIA | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| 数据准备 | 视频来源和外科医生数量 阅读提示:Methods: Surgical gesture data |
| 模型训练 | 训练/验证/测试划分比例 阅读提示:Methods: Video dataset processing and frame classifier training pipeline |
| 手势序列生成 | 采样间隔和滑动窗口长度 阅读提示:Methods: Automatic gesture sequence recognition in a video |
| 特征工程 | 特征总数 阅读提示:Methods: Feature engineering for clinical outcome prediction |
| 结局预测 | 患者样本量 阅读提示:Methods: Surgical gesture data |