【协和医学杂志】基于动静脉双期CT的深度学习模型在胰腺囊性病变良恶性鉴别诊断中的应用价值
时间:2026-08-24 23:17:31 热度:37.1℃ 作者:网络
深度解析医学证据,lxfs.net为你支撑决策
近年来,胰腺囊性病变(PCLs)在人群中的检出率逐年升高[1],其术前良恶性鉴别是临床管理的关键,直接关系到患者治疗策略的选择[2-3]。准确识别具有恶变潜能的PCLs(导管内乳头状黏液性肿瘤和黏液性囊性肿瘤)[4],有助于及时实施手术干预;而对于良性病变(如浆液性囊腺瘤),则可避免不必要的外科手术及相关风险。因此,建立一种准确、无创的术前评估方法具有重要临床意义。
随着影像学技术的发展,尤其是多期增强CT的广泛应用,为PCLs的无创评估提供了有了支持手段[5]。不同期相影像能够反映病变的血供特征及内部结构差异,在PCLs良恶性鉴别中展现出良好的潜在价值。目前临床主要依赖影像学表现并结合相关指南进行PCLs性质的综合判断[6-7],该过程在一定程度上依赖于医师经验,存在主观性较强、重复性有限等问题。
近年来,影像组学等方法被用于PCLs的定量分析,通过提取高通量影像特征构建预测模型,在一定程度上提高了诊断效能[8-9]。然而,此类方法对图像分割及特征工程依赖性较强,模型的稳定性和泛化能力仍有待进一步提高[10-11]。深度学习模型能够从原始影像中自动学习病变特征,为医学影像诊断开辟了新的研究方向[12-13]。基于此,本研究以术后病理结果为金标准,开展单中心回顾性研究,构建基于动静脉双期CT影像的深度学习模型,并在独立数据集上验证其在PCLs良恶性鉴别中的诊断性能,以期为临床术前评估提供参考依据。
1 资料与方法
1.1 研究对象
本研究为单中心回顾性队列研究,纳入2014年6月1日—2023年5月31日北京协和医院手术证实的PCLs患者为研究对象。
纳入标准:(1)PCLs均有明确的手术病理良恶性诊断结果;(2)术前3个月内进行包含层厚≤5 mm的动脉期和静脉期增强CT检查,多次检查者仅取距离手术最近的一次影像学资料;(3)CT检查前患者未实施任何治疗(如抽吸囊液、化疗、放疗)。
排除标准:图像质量不佳,有影响胰腺及病变显示的伪影。
CT影像资料均保存于北京协和医院影像存档与通信系统(PACS),本研究以病灶为单位进行分析(同一患者可能同时存在良性与恶性病灶)。依据病变的良恶性进行分层随机抽样,按3∶1∶1的比例将数据随机划分为训练集、验证集和测试集。在划分过程中,确保同一患者的所有病灶均归属于同一个子集,以避免数据泄露对模型评估造成偏倚。其中,训练集用于模型训练,计算损失函数并进行梯度下降优化;验证集用于超参数调优及最佳模型筛选;测试集则用于最终评估模型的诊断性能。
本研究方案已通过北京协和医院伦理审查委员会审批(审批号:I-25PJ0299)。在数据处理过程中对患者信息进行了严格的匿名化脱敏处理,并豁免入组患者的书面知情同意。
1.2 研究方法
1.2.1 CT影像采集参数
所有入组患者术前均行多排螺旋CT扫描,设备包括 Siemens SOMATOM Definition Flash、Siemens SOMATOM Force 及 Philips IQon Spectral CT。采用双期增强扫描方案,所有图像均以 DICOM 格式存储,矩阵为512×512,层厚及重建间隔均为1 mm。
扫描参数如下:管电压120 kVp,管电流采用自动调节技术;各设备的螺距分别为0.7、0.6和1.172,准直分别为 128×0.6 mm、192×0.6 mm和64×0.625 mm,机架旋转时间分别为0.5 s、0.5 s和0.75 s。
增强扫描采用自动高压注射器经静脉注射非离子型碘对比剂(Ultravist,370 mg/mL,Schering,德国),注射剂量为 80 mL,流率为 3.0 mL/s,并结合阈值触发技术确定扫描时机。动脉期扫描于主动脉强化达到 100 HU 后约 15 s 启动,静脉期扫描则在动脉期结束后约30 s进行采集。
1.2.2 病灶勾画与影像预处理
胰腺区域与病灶区域由2名具有丰富胰腺影像经验的放射科医师使用ITK-SNAP软件进行独立勾画,确保覆盖整个胰腺囊性病变。若存在分歧,由第3名资深放射科医师仲裁,以形成最终的分割掩膜(Mask)。两名医师初始分割的一致性以Dice系数评估,要求病灶分割Dice大于0.87,胰腺分割Dice大于0.91。
在勾画完成后,对所有原始图像及分割掩膜执行预处理流程。首先,对所有 CT 影像进行各向同性体素重采样,将体素尺寸统一为 0.75×0.75×1.0 mm3。其中,影像采用三线性插值,而分割掩膜则使用最近邻插值,以避免分割边界模糊。为降低极端噪声对组学特征的影响,对CT灰度值(HU)进行截断处理:将HU值限定在-160 HU至240 HU的软组织窗口范围内,超出该范围的体素值分别设为下限或上限值。
在图像配准方面,动静脉期影像采用基于深度神经网络的VoxelMorph[14]进行配准。最后,以病灶边界框为中心,裁切出大小为192×192×160体素的感兴趣区(VOI),作为后续模型的输入。
1.2.3 基于动静脉双期CT影像特征的深度学习模型构建
本研究构建基于三维卷积神经网络(3D CNN)的分类模型,包括ResNet50[15]、DenseNet121[16]、MobileNetV2[17]、ResNeXt50[18]、EfficientNet-b5[19],用于PCLs良恶性鉴别。模型以动脉期和静脉期CT影像为基础输入,结合解剖与病灶信息,实现多模态特征融合。如图1所示,模型输入为四通道三维体数据,包括动脉期CT影像、静脉期CT影像、胰腺区域分割掩膜、病灶区域分割掩膜。所有掩膜均在静脉期影像上完成勾画,双期配准时以静脉期影像为基准影像,将动脉期向静脉期解剖结构对齐。

图1 基于动静脉双期CT的深度学习PCLs良恶性鉴别模型框架图
PCLs:胰腺囊性病变;VOI:感兴趣区
所有输入数据均被裁剪为统一尺寸的三维VOI,大小为192×192×160体素。四通道三维体数据输入三维卷积骨干网络后,分别应用下采样后的胰腺实质掩膜(胰腺掩膜去除病灶区域)和病灶掩膜对输出的空间特征进行基于掩膜的空间特征池化(VOI池化),从而提取出胰腺特征与病灶特征。两类特征经拼接融合后输入分类器,通过Sigmoid激活函数输出病灶为恶性的预测概率,最终得到恶性预测结果。
模型训练采用交叉熵损失函数(cross-entropy loss)作为优化目标,用于度量预测概率与真实标签之间的差异。参数优化方面,批次大小(batch size)设置为4,总迭代轮数(epoch)为80轮。优化器选用AdamW,该优化器在Adam基础上引入了权重衰减项,有助于提升模型的泛化能力,权重衰减系数设为1×10-5。学习率调度采用“线性预热(linear warm-up)+ 余弦退火(cosine annealing)”策略:训练初期经总迭代轮数的10%,期间学习率从0线性增至预设基础学习率(5×10-5),随后按照余弦函数逐步衰减至接近0,以提高训练稳定性并促进模型收敛。
为提升模型的鲁棒性并减少过拟合,对训练数据进行在线数据增强处理,包括:随机旋转(最大旋转角度20°,应用概率0.8)、随机弹性形变(最大位移5个体素,约占胰腺体素范围的3%~5%,应用概率0.8)、随机翻转(沿三个坐标轴,应用概率0.1)。其中弹性形变采用平滑形变场生成方法,以模拟真实解剖结构的非刚性变化。模型训练与推理均在GPU服务器上完成,运行环境为Ubuntu 20.04,使用NVIDIA GeForce RTX 4090 GPU。深度学习框架为PyTorch(版本2.4.1),Python版本为3.10.12。
模型的判别性能通过受试者操作特征(ROC)曲线进行评估,曲线下面积(AUC)采用非参数方法(trapezoidal rule)计算。AUC的95%置信区间(CI)通过自助法(Bootstrap,重复抽样2000次)获得。不同模型之间AUC的比较采用DeLong检验;分类准确率的比较采用McNemar检验,用于评估两个分类模型在配对样本上的预测一致性差异。
除ROC曲线外,以召回率(recall)为横坐标、精确度(precision)为纵坐标,绘制Precision-Recall曲线,以评估模型在阳性样本识别中的性能。模型输出的连续预测概率用于绘制概率密度分布图,以直观观察两类样本预测概率的分离程度及重叠范围。
模型的最佳分类阈值基于验证集中的约登指数(Youden index)确定。模型的校准能力通过校准曲线(calibration curve)进行评估,并计算Brier分数作为整体校准误差指标。进一步采用Logistic回归模型对预测概率进行回归分析,获得校准截距(intercept)和校准斜率(slope),以定量评价模型的校准性能。
基于验证集中约登指数确定模型的最佳阈值,将模型预测概率转化为二分类结果,并构建混淆矩阵,统计真阳性、假阳性、真阴性和假阴性例数。在此基础上,计算准确率、灵敏度和特异度等分类指标。为评估阈值选择对模型性能的影响,绘制性能-阈值曲线,展示不同分类阈值下准确率、灵敏度和特异度等指标的变化趋势,并辅助判断推荐阈值下各性能指标的平衡性。
临床应用价值通过决策曲线分析(DCA)进行评估,计算不同阈值概率下的净获益(net benefit)。此外,绘制临床影响曲线(clinical impact curve),以评估不同阈值下预测为高风险人群中真实阳性个体的数量。
以AUC为主要评价指标,并结合准确率、灵敏度、特异度等指标筛选最佳模型,用于后续的验证和分析。
1.2.4 单期模型构建及与动静脉双期模型比较
为评估不同增强期相CT影像在PCLs良恶性鉴别中的价值,本研究在相同数据集划分基础上分别构建单动脉期、单静脉期模型,并与基于动静脉双期CT的深度学习PCLs良恶性鉴别模型的诊断性能进行比较。单动脉期模型以动脉期CT影像、胰腺掩膜及病灶掩膜作为输入;单静脉期模型以静脉期CT影像、胰腺掩膜及病灶掩膜作为输入。所有模型均采用相同的三维VOI裁剪策略,输入尺寸统一为192×192×160体素。为保证不同期相模型之间的可比性,单期模型与双期模型均采用相同的训练集、验证集和测试集划分,并保持网络主干结构、损失函数、优化器、学习率调度策略及数据增强方式一致。模型训练过程中,训练集用于参数学习,验证集用于模型选择及阈值确定,测试集用于最终性能评估。
以术后组织病理为金标准,分别计算各模型ROC曲线的AUC、准确率、灵敏度及特异度。通过比较单期模型与双期模型在验证集和测试集中的诊断性能,评估动脉期与静脉期影像信息融合对模型良恶性鉴别能力的增益价值。
1.2.5 传统影像组学模型构建及与深度学习模型比较
为进一步评价基于动静脉双期CT影像特征深度学习模型的诊断性能,本研究构建基于传统影像组学特征的预测模型,并在相同测试集中与最佳深度学习模型进行性能比较。传统影像组学模型采用与深度学习模型相同的数据来源、病灶分割方法及预处理流程。
经配准及标准化处理后的动脉期与静脉期CT影像,分别以“病灶掩码+静脉期影像”“病灶掩码+动脉期影像”“胰腺实质掩码+静脉期影像”“胰腺实质掩码+动脉期影像”4种组合方式提取影像组学特征,所提取特征包括一阶统计特征、形状特征及纹理特征等。随后,将提取的4组影像组学特征进行拼接,并结合后续特征筛选步骤输入模型,以充分融合胰腺实质与病灶、动脉期与静脉期的影像信息。
为减少特征冗余并降低过拟合风险,在建模过程中首先对提取的特征进行标准化处理,随后开展特征筛选。初步筛选采用基于方差分析(ANOVA F 检验)的特征选择方法,假阳性率控制在α=0.10;继而采用最小绝对收缩和选择算子(LASSO)回归法进一步筛选。
LASSO具体流程如下:在训练集中,采用5折交叉验证对模型参数进行优化。正则化强度通过对50个不同的C值进行搜索确定,其中C为正则化参数λ的倒数。模型以负对数损失(negative log loss)作为性能评价指标,选择平均交叉验证表现最佳的参数组合,从而确定最优的LASSO Logistic回归模型。在训练阶段,传统影像组学模型于训练集与验证集的并集上采用10次10折交叉验证进行超参数调优和模型选择,最终在独立测试集中完成性能评估。模型输出每个病灶为恶性的预测概率,并依据交叉验证过程中确定的最佳阈值进行二分类判别。
传统影像组学模型与基于动静脉双期CT影像深度学习模型均在相同的独立测试集中进行性能评价。以术后病理为金标准,分别计算两类模型的AUC、准确率、灵敏度及特异度,并比较其在PCLs良恶性鉴别中的诊断表现,以评估深度学习自动特征学习方法相较于传统影像组学手工特征建模方法的潜在优势。
1.2.6 放射科医师阅片评价
为进一步评估基于动静脉双期CT影像深度学习模型相较于临床人工阅片的诊断表现,本研究邀请1名具有3年腹部影像诊断经验的放射科医师对独立测试集进行阅片。该医师在不知晓术后病理结果及深度学习模型预测结果的前提下,独立回顾测试集中每个PCLs病灶的动脉期与静脉期增强CT图像,依据常规影像学征象(如病灶大小、囊壁或分隔强化、壁结节、实性成分、主胰管扩张及周围组织侵犯等)对病变作出良性或恶性判断。
为减少记忆偏倚并评估人工阅片的稳定性,该医师在首次阅片完成1个月后,再次在不知晓病理结果、模型预测结果及首次阅片结果的情况下进行第二次独立阅片。以术后病理结果为金标准,分别计算深度学习模型及放射科医师两次阅片的准确率、灵敏度与特异度。鉴于本研究中放射科医师阅片评价旨在提供临床参照,深度学习模型与医师诊断性能之间仅进行Kappa一致性分析,不进行统计学差异检验。
1.3 统计学处理
所有统计分析均在 Python(V3.10.12)环境中完成,主要依赖 scipy、statsmodels 及 scikit-learn 等库。计量资料经正态性检验(Shapiro-Wilk检验)均不符合正态分布,以中位数(四分位数)表示,组间比较采用Kruskal-Wallis H 检验。计数资料以频数(百分比)表示,组间比较采用卡方检验(理论频数<5时采用Fisher精确概率法)。所有统计检验均为双侧检验,以P<0.05为差异具有统计学意义。
2 结果
2.1 一般临床资料
最终纳入PCLs患者480例,包含485个病灶样本(恶性206个,良性279个)。训练集、验证集、测试集分别包含291个、97个、97个病灶样本,对应患者分别为288例、96例和96例。在划分数据集时,以病灶为最小单位,并确保同一患者的所有病灶均属同一个子集,无样本泄露。3组恶性病灶比例及人口统计学特征(年龄、性别)、临床特征(癌胚抗原、糖类抗原19-9、合并黄疸、新发糖尿病、胰腺炎史)均无统计学差异(P均>0.05),提示组间具有良好的可比性(表1)。
表1 训练集、验证集及测试集患者基本信息和临床特征

2.2 深度学习模型在验证集与测试集中的性能
本研究构建了基于动静脉双期CT影像特征的5种深度学习模型,均在相同训练集中进行训练,在验证集上根据约登指数获得最佳良恶性鉴别判决阈值,并在验证集中进行性能比较,进而筛选最优模型。在验证集中,各模型均展现出一定的PCLs良恶性鉴别能力。ROC曲线显示,各模型的AUC大多在0.800以上,其中ResNeXt50模型的AUC最高(0.837),提示5种模型整体具有较好的区分效能,各模型之间的总体判别性能较为接近(图2A,表2)。

图2 5种基于动静脉双期CT影像特征的深度学习模型在验证集中的表现
A.ROC曲线
表2 5种基于动静脉双期CT影像特征的深度学习模型在验证集中的诊断性能展示

Precision-Recall曲线显示,所有模型的曲线均位于基线准确率(验证集恶性比例为42.3%)之上,表明各模型在验证集中均具备良好的PCLs良恶性鉴别能力,且整体性能较为接近[各模型的平均精度(AP)差异不大,图2B]。

图2 5种基于动静脉双期CT影像特征的深度学习模型在验证集中的表现
B.Precision-Recall曲线
准确率方面,各模型在验证集中的准确率介于74.23%~77.32%之间。其中,ResNeXt50与ResNet50的准确率最高(77.32%),余模型准确率略低,但整体差异较小(表2)。灵敏度方面,不同模型之间差异较为明显(表2)。其中,ResNeXt50模型的灵敏度最高(80.49%)。高灵敏度的模型在识别恶性病灶方面具有更强能力,有助于降低恶性病变的漏诊风险。特异度方面,其值介于73.21%~87.50%之间,其中最高者为ResNet50模型(表2)。
为进一步比较各模型的AUC与准确率差异,本研究采用DeLong检验和McNemar检验,分别将ResNeXt50模型与其他模型进行两两比较,结果如图3所示。

图3 5种基于动静脉双期CT影像的深度学习模型在验证集中的AUC、准确率变化量统计学比较
A.AUC;B.准确率
在AUC方面,ResNeXt50模型相较于MobileNetV2、DenseNet121、EfficientNet-b5及ResNet50模型均呈现正向提升,提示其在区分能力上具有更好的表现趋势。在准确率方面,ResNeXt50模型相较于DenseNet121、MobileNetV2及EfficientNet-b5模型均表现出更高的点估计值,与ResNet50模型相比则基本持平。
整体而言,虽然ResNeXt50模型的AUC、准确率点估计值更高,但与其他模型差异值的置信区间均跨越0,提示各模型之间AUC、准确率统计学检验未达显著性水平。因此,上述结果仅提示ResNeXt50模型在AUC和准确率方面呈现一定的性能优势,尚不能认为其显著优于其他网络结构。
综合AUC、准确率、灵敏度及特异度结果,ResNeXt50在验证集中同时具有最高的AUC、灵敏度及准确率,且各指标分布较为均衡,初步认为该模型为最优模型。该模型在验证集中的校准截距为-0.831,校准斜率为0.978,根据约登指数确定PCLs良恶性鉴别的最佳判决阈值为0.442。
在测试集中,本研究构建的ResNeXt50模型仍保持了较好的性能。临床影响曲线分析结果所示,随着PCLs良恶性鉴别判决阈值逐渐增大,模型输出的高风险样本中真阳性比例逐步上升,且在多数阈值范围内,模型预测的高风险患者数与实际真阳性患者数之间保持较为接近的变化趋势(图4A)。

图4 ResNeXt50模型在测试集中的鉴别性能表现
A.临床影响曲线
这表明模型不仅能有效筛选出一定数量的高风险个体,且其中相当一部分为真阳性病例,揭示了其在临床风险分层中具有实用价值。DCA结果显示,在较宽的概率阈值范围内(0.17~0.80),模型曲线均位于两条参考线之上,说明基于该模型进行临床决策可使患者获益(图4B)。

图4 ResNeXt50模型在测试集中的鉴别性能表现
B.决策曲线
尤其在中低阈值区间,模型净获益较为稳定,表明其适用于辅助筛查或早期风险识别;而当阈值过高时,净获益下降,提示在高阈值条件下模型的决策优势减弱。在区分能力方面,概率密度分布图展示了阳性与阴性样本预测概率的分布密度。两类样本基本呈单峰分布,虽存在一定重叠,但整体分离趋势较清晰(图4C)。

图4 ResNeXt50模型在测试集中的鉴别性能表现
C.概率密度分布图
根据验证集所确定的最佳良恶性鉴别判决阈值(0.442)落在较好的判决位置,提示模型具备一定鉴别能力,该阈值可作为模型分类决策的参考截点。性能-阈值曲线进一步验证了模型及其判决阈值的稳定性。随着判决阈值升高,模型灵敏度逐渐下降,特异度逐渐上升。在阈值0.442附近,灵敏度、特异度及总体性能指标之间达到相对平衡,提示该阈值在减少漏诊与控制误诊之间取得了较好的折中,适合作为模型应用时的推荐阈值(图4D)。

图4 ResNeXt50模型在测试集中的鉴别性能表现
D.性能-阈值曲线
校准曲线显示(图4E),模型预测概率与实际观察结果总体一致,但在较低概率区间存在一定偏差。

图4 ResNeXt50模型在测试集中的鉴别性能表现
E.校准曲线
Brier分数为0.183,校准截距为-0.522,校准斜率为0.598。负截距提示模型整体预测概率略有偏高,而斜率<1表明模型在不同风险区间的区分能力有限。尽管校准曲线整体趋势向好,但与理想值仍存在一定偏离,总体来看模型概率输出存在一定校准不足。未来在外部验证前,需进一步进行后校准处理。混淆矩阵显示,在阈值为0.442时,模型正确识别出37例阴性和34例阳性病例,出现19例假阳性和7例假阴性病例(图4F)。

图4 ResNeXt50模型在测试集中的鉴别性能表现
F.混淆矩阵
该结果提示,模型在测试集中对阳性病例具有较高灵敏度,漏诊例数相对较少,可能更适合探索性地应用于临床筛查、风险预警或辅助决策场景。
综上所述,ResNeXt50模型在独立测试集中展现出较好的判别能力,并在一定阈值范围内具有潜在的临床净获益;但其概率校准仍存在不足,需进一步进行后校准及外部验证。验证集与测试集结果较接近,未提示明显过拟合,但模型的临床应用潜力仍需更多外部验证予以支持。
2.3 双期模型与单期模型性能比较
为评估不同期相CT影像特征在PCLs良恶性鉴别中的价值,本研究分别构建了基于单动脉期、单静脉期影像的ResNeXt50深度学习模型,并与基于动静脉双期模型在相同数据集上进行性能比较。在验证集中,基于动脉期、静脉期及动静脉双期模型的AUC分别为0.794、0.804和0.837;在测试集中,三者的AUC分别为0.785、0.796和0.822。上述结果表明,融合双期影像信息有助于提升模型的鉴别性能(表3)。
表3 基于不同期相CT影像的ResNeXt50模型性能比较

在准确率、灵敏度及特异度方面,双期模型整体表现较为均衡。在测试集中,双期模型的准确率、灵敏度及特异度分别为73.20%、82.93%和66.07%;动脉期模型分别为69.07%、73.17%和66.07%;静脉期模型分别为72.16%、65.85%和76.79%(表3)。
总体而言,双期模型在验证集与测试集中的AUC、准确率及灵敏度均相对较高,提示动静脉双期信息融合可能为模型提供了补充信息。然而,各模型性能指标的95% CI存在重叠,且本研究样本量有限,尚不能认为双期模型显著优于单期模型。该结论仍需在更大样本及外部数据集中进一步验证。
2.4 深度学习模型与传统影像组学模型比较
为进一步评估基于动静脉双期CT影像特征ResNeXt50深度学习模型的诊断性能,本研究构建了基于传统影像组学特征的预测模型,并在相同数据集上将其与ResNeXt50深度学习模型进行比较。为确保比较的公平性与可靠性,传统影像组学模型与深度学习模型采用完全相同的验证集。
为防止超参数选择偏移及过拟合风险,传统影像组学模型在训练集与验证集的并集上进行了10次10折交叉验证以完成超参数调优。传统影像组学模型所使用的双期影像与深度学习模型采用完全相同的配准方式,并以配准后的双期影像作为输入。特征提取方面,分别以“病灶掩码+静脉期影像”“病灶掩码+动脉期影像”“胰腺实质掩码+静脉期影像”“胰腺实质掩码+动脉期影像”4种组合提取影像组学特征,并将4组特征进行拼接,以确保特征的充分融合及模型对比的公平性。
在测试集中,ResNeXt50深度学习模型鉴别诊断PCLs良恶性的AUC、准确率及灵敏度均高于传统影像组学模型(表4)。
表4 ResNeXt50深度学习模型与传统影像组学模型在测试集中的诊断性能比较

具体而言,深度学习模型的AUC为0.822(95% CI:0.737~0.904),高于传统影像组学模型的0.765(95% CI:0.663~0.860)。尽管差异尚未达统计学显著性(P=0.261),但深度学习模型AUC较传统影像组学模型提高约5.7%,显示出一定的性能提升趋势。
在分类性能方面,深度学习模型的准确率为73.20%(95% CI:63.24%~81.68%),高于传统影像组学模型的67.01%(95% CI:56.73%~76.22%),但差异亦未达统计学显著性(P=0.273)。
进一步分析灵敏度和特异度,深度学习模型的灵敏度为82.93%(95% CI:67.94%~92.85%),高于传统影像组学模型的65.85%(95% CI:49.41%~79.92%),差异未达统计学显著性(P=0.052),提示深度学习模型在检出恶性或高风险病变方面可能具有潜在优势,有助于降低漏诊风险。
深度学习模型的特异度为66.07%(95% CI:52.19%~78.19%),与传统影像组学模型的67.86%(95% CI:54.04%~79.71%)基本持平(P=0.808)。
总体而言,相较于传统传统影像组学模型,ResNeXt50深度学习模型在测试集中的AUC、准确率及灵敏度均更高,但差异尚未达统计学显著性。因此,现阶段更宜将其视为一种具有潜在价值的辅助方法,其显示出一定的性能提升趋势,具备PCLs风险分层及辅助诊断的潜力。未来需通过更大样本、多中心的外部验证,进一步确认其临床应用价值。
2.5 深度学习模型与放射科医师诊断性能比较
为进一步评估基于动静脉双期CT影像特征ResNeXt50深度学习模型的临床应用价值,本研究将该模型在独立测试集中的诊断性能与1名放射科医师的阅片结果进行比较。该医师在不知晓病理结果及模型输出结果的情况下,对测试集PCLs进行良恶性判断,并于间隔1个月洗脱期后完成第二次独立阅片。结果显示,在测试集中,深度学习模型的准确率、灵敏度及特异度分别为73.20%、82.93%和66.07%。
放射科医师第一次阅片的准确率、灵敏度及特异度分别为75.26%、80.49%和71.43%;第二次阅片分别为73.20%、85.37%和64.29%。医师两次评价之间的一致性较高,Kappa值为0.794。深度学习模型与医师第一次、第二次阅片结果之间的Kappa值分别为0.794和0.791,提示模型诊断结果与医师判断具有较好的一致性(表5)。
表5 ResNeXt50深度学习模型与放射科医师在测试集中的诊断性能比较

模型的准确率为73.20%,与医师第二次阅片结果相同,略低于第一次阅片。模型灵敏度为82.93%,高于医师第一次阅片,略低于第二次阅片,提示模型在测试集中对恶性或高风险PCLs具有较高的检出率趋势。模型的特异度为66.07%,低于医师第一次阅片,但略高于第二次阅片。从描述性结果来看,深度学习模型的准确率、灵敏度及特异度与医师两次阅片结果处于相近范围。然而,由于本研究仅纳入1名放射科医师且样本量较小,上述结果不宜解释为模型诊断性能与医师相当或优于医师,而应理解为模型输出与人工阅片结果具有一定一致性,可作为临床判断的辅助参考。
3 讨论
本研究基于动静脉双期增强CT影像特征构建了用于PCLs良恶性鉴别诊断的深度学习模型,并在独立测试集中进行了验证。结果显示,ResNeXt50模型的表现最佳,该模型在验证集与测试集中的AUC分别为0.837(95% CI:0.748~0.915)和0.822(95% CI:0.737~0.904),具有较好的判别能力;同时在校准曲线及决策曲线分析中亦表现出一定的一致性与潜在临床获益。上述结果表明,基于动静脉双期CT影像的深度学习方法有望作为PCLs术前评估的辅助工具。
3.1 深度学习模型的诊断价值
PCLs的临床管理重点在于识别具有恶性或恶变潜能的病灶。传统影像学判断主要依赖病灶大小、囊壁或分隔强化、壁结节、实性成分、主胰管扩张及周围组织侵犯等征象,但不同病理类型之间的影像表现存在重叠,且诊断结果易受阅片者经验的影响。本研究采用3D CNN直接对CT影像进行建模,能够在保留病灶空间结构信息的基础上自动学习复杂影像模式,从而在一定程度上减少对人工经验及预设征象的依赖。
在不同网络结构的比较中,ResNeXt50模型的AUC、准确率及灵敏度均最高,提示基于动静脉双期CT影像的深度学习方法能够从常规影像资料中提取具有诊断价值的高维特征,可为PCLs术前风险评估提供辅助信息,故该模型被选为后续测试集评估的代表模型。
需要强调的是,各模型之间AUC、准确率统计学差异未达显著水平,且置信区间存在重叠,因此尚不能认为ResNeXt50显著优于其他网络结构。其性能提升趋势可能与聚合残差结构增强了特征表达能力有关,使模型能够更充分地捕捉囊壁、分隔、实性成分、病灶内部异质性及周围胰腺实质改变等多层级信息。
值得注意的是,本研究ResNeXt50模型在测试集中的灵敏度较高,但由于测试集样本量有限,该结果仍需在更大规模的独立数据中予以验证。对于PCLs而言,漏诊恶性或高危病变可能延误治疗时机,因此,较高的灵敏度具有重要临床意义。本研究结果提示,ResNeXt50模型可能更适用于术前筛查、风险预警或多学科讨论中的辅助判断,帮助临床医生识别需重点关注的高风险病灶。然而,模型的特异度仍有提升空间,说明其目前尚不宜单独作为决定手术或排除恶性风险的依据,而应结合临床资料、实验室指标、MRI、内镜超声及医师综合判断、共同使用。
3.2 双期CT影像的补充价值
本研究进一步比较了基于动脉期、静脉期及动静脉双期ResNeXt50深度学习模型的诊断表现。结果显示,双期模型在验证集与测试集中的AUC均高于单期模型,且在测试集中表现出较高的灵敏度,提示动脉期与静脉期影像信息可能具有一定互补价值。然而,不同模型之间AUC差异尚未达统计学显著性,未来需通过更大样本及多中心外部验证进一步确认。
动脉期影像更有利于显示病灶内实性成分、壁结节及血供相关特征,而静脉期影像则便于观察囊壁、分隔、病灶边界及其与周围胰腺实质的关系。PCLs恶性风险通常并非由单一征象决定,而是由形态、强化方式、内部结构及周围组织改变等多种信息共同反映。因此,单一期相可能难以全面表征病灶的异质性,而双期增强CT能够提供更丰富的结构与血流动力学信息,从而有助于模型学习与恶性风险相关的影像特征。
此外,本研究将胰腺掩膜与病灶掩膜作为输入通道,使模型在分析病灶本身的同时获得解剖区域的先验信息。PCLs的诊断不仅取决于病灶内部表现,还与病灶位置、胰腺背景、周围实质改变及邻近结构关系密切相关。引入掩膜信息有助于模型聚焦于诊断相关区域,减少无关背景的干扰,并提升特征学习的效率。未来若能进一步整合主胰管分割、病灶空间定位、胰腺萎缩程度及周围血管结构等信息,有望进一步提升模型对复杂影像征象的识别能力。
3.3 与传统影像组学模型的比较
本研究在相同测试集中比较了基于动静脉双期CT影像ResNeXt50深度学习模型与传统影像组学模型的诊断表现。结果显示,深度学习模型在AUC、准确率和灵敏度方面的点估计值高于传统影像组学模型,提示自动特征学习方法可能具有一定潜在价值。
影像组学方法通过提取形状、一阶统计量和纹理等预定义特征进行建模,具有一定可解释性,但其性能易受图像预处理、病灶分割、特征筛选、模型调参及扫描参数差异影响。相比之下,深度学习模型能够直接从原始三维影像中学习多层级抽象特征,更适合捕捉复杂、非线性且难以由人工特征完全描述的影像模式。本研究中深度学习模型灵敏度点估计值高于传统影像组学模型,提示其在识别恶性或高危病变方面可能具有一定潜在价值。
然而,两种模型在AUC和准确率方面的差异尚未达统计学显著性,说明深度学习模型虽显示出性能提升趋势,但目前仍不能认为其已全面替代影像组学方法。影像组学特征具有较好的可解释性,而深度学习特征具有更强的自动表达能力,二者可能存在互补关系。未来可探索深度学习特征、影像组学特征及临床指标的融合建模,以进一步提高模型性能和临床可解释性。
3.4 与放射科医师诊断表现的比较
本研究将基于动静脉双期CT影像ResNeXt50深度学习模型与放射科医师的阅片结果进行了比较。结果显示,模型准确率与医师两次阅片结果处于相近范围,且Kappa分析提示模型与医师判断具有较好的一致性。然而,由于本研究样本量较小,且仅纳入1名放射科医师进行阅片,因此尚不宜认为模型性能已达到医师水平。
PCLs的影像学判断具有一定复杂性。不同病理类型之间影像表现重叠,部分恶性或高危病变可能缺乏典型征象,而部分良性病变也可表现为复杂的囊壁、分隔或强化特征。因此,即使具备胰腺影像诊断经验的医师,在不同时间阅片时仍可能出现诊断结果的波动。本研究中医师两次评价的灵敏度与特异度存在一定差异,也在一定程度上反映了该类病变诊断中的主观性与不确定性。
总体而言,放射科医师在间隔1个月后的重复评价中,准确率、灵敏度及特异度均存在一定波动,提示PCLs的影像学判断受主观经验及病例特征影响,存在一定的诊断不确定性。相比之下,深度学习模型基于统一算法对影像特征进行分析,理论上可提供更为客观、可重复的量化参考,经验证其在PCLs良恶性鉴别中的诊断表现与放射科医师具有一定的一致性。因此,深度学习模型的临床价值更适宜定位于辅助工具,而非替代放射科医师。其预测结果可为疑难病例或多学科讨论提供补充信息,但仍需结合临床资料、实验室指标及医师综合判断进行使用。
3.5 模型临床应用价值与局限性
除判别能力外,模型是否具有临床应用价值还取决于其概率校准效果及决策获益。本研究结果显示,基于动静脉双期CT影像特征的ResNeXt50模型在一定阈值范围内使患者具有潜在净获益,提示其可用于辅助临床风险分层。对于PCLs的管理而言,临床决策通常需在漏诊恶性病变与避免过度手术之间取得平衡。若模型能够在中低风险阈值区间提供稳定的预测结果,则有助于筛选需进一步评估的患者,并减少单纯依赖主观阅片所带来的不确定性。
然而,本研究发现模型的概率输出存在一定校准不足。较高的AUC表明模型具备良好的风险排序能力,但校准不足可能影响绝对风险的解读及临床阈值的设定。例如,在决定是否进行短期复查、内镜超声或手术干预时,临床医生不仅需要了解病灶风险的相对高低,还需要相对可靠的风险概率。因此,在模型临床部署前,应进一步进行后校准处理,并在外部数据中验证其概率输出的稳定性与可靠性。
本研究存在一定局限性。第一,为单中心回顾性研究,病例来源及扫描流程相对集中,模型在其他中心、不同CT设备及不同扫描协议下的泛化能力尚需验证。第二,纳入病例均为接受手术并获得病理结果的患者,恶性或高危病变比例可能高于普通筛查或随访人群,存在一定的选择偏倚。第三,尽管本研究样本量具有一定规模,但对于深度学习模型训练及多模型比较而言仍相对有限。样本量较小可能导致置信区间较宽,降低统计检验效能,使得不同深度学习模型之间、单期与双期模型之间,以及深度学习模型与传统影像组学模型之间的真实差异难以被充分检出。
因此,本文中涉及模型间性能差异的相关结果主要应作为探索性分析与趋势性发现进行解读,而不宜作为确定性结论。第四,模型依赖人工勾画胰腺及病灶区域,虽有助于保证输入区域的准确性,但增加了临床应用成本,并可能受到分割一致性的影响。第五,本研究主要基于CT影像特征,尚未整合MRI、内镜超声、囊液分析、血清肿瘤标志物及临床症状等多模态信息,对复杂临床场景的综合判断能力仍有提升空间。
未来研究应在多中心、跨设备及跨扫描协议的数据中开展外部验证,以评估模型的泛化能力;同时扩大样本量,针对不同病理亚型进行精细化分析。进一步结合CT、MRI、内镜超声及临床指标构建多模态模型,有望提高复杂病例的诊断准确性。此外,发展自动分割与分类一体化流程以减少人工勾画依赖,并通过可视化方法增强模型的可解释性,将有助于推动模型向真实临床工作流的转化。
4 小结
本研究构建的基于动静脉双期增强CT影像特征的三维深度学习模型在PCLs良恶性鉴别中展现出一定的诊断价值。双期影像融合可为模型提供潜在的补充信息;相较于传统影像组学模型,深度学习模型在部分指标的点估计值上呈现较高趋势,且与放射科医师的诊断结果具有较好的一致性。然而,由于本研究样本量有限,部分模型间的比较未达到统计学显著性,相关结果仍需谨慎解读。模型的特异度、概率校准能力、外部泛化能力及与临床工作流的适配性,尚待进一步优化与验证。
参考文献
[1]Mohapatra S, Krishna S G, Pannala R. Pancreatic cystic neoplasms: translating guidelines into clinical practice[J]. Diagnostics (Basel), 2023, 13(4): 749.
[2]Gardner T B, Park W G, Allen P J. Diagnosis and management of pancreatic cysts[J]. Gastroenterology, 2024, 167(3): 454-468.
[3]Gonda T A, Cahen D L, Farrell J J. Pancreatic cysts[J]. N Engl J Med, 2024, 391(9): 832-843.
[4]Stark A, Donahue T R, Reber H A, et al. Pancreatic cyst disease: a review[J]. JAMA, 2016, 315(17): 1882-1893.
[5]Vetro V, Agnello F, Raitano E, et al. CT and MRI of pancreatic cystic lesions: tricks of the trade[J]. J Med Imaging Interv Radiol, 2024, 11(1): 39.
[6]Chatterjee A, Stevens T, Chahal P. Diagnosis and management of pancreatic cystic lesions for the non-gastroenterologist[J]. Cleve Clin J Med, 2024, 91(2): 96-102.
[7]Miller F H, Lopes Vendrami C, Recht H S, et al. Pancreatic cystic lesions and malignancy: assessment, guidelines, and the field defect[J]. Radiographics, 2022, 42(1): 87-105.
[8]Cheng S H, Hu G, Zhang S B, et al. Machine learning-based radiomics in malignancy prediction of pancreatic cystic lesions: evidence from cyst fluid multiomics[J]. Adv Sci (Weinh), 2025, 12(20): e2409488.
[9]Awe A M, Vanden Heuvel M M, Yuan T Y, et al. Machine learning principles applied to CT radiomics to predict mucinous pancreatic cysts[J]. Abdom Radiol (NY), 2022, 47(1): 221-231.
[10]Lettner J D, Evrenoglou T, Binder H, et al. AI-based radiomics for pancreatic cysts: high diagnostic performance amid a persistent translational gap[EB/OL]. (2026-02-12)[2026-03-30]. https://www.medrxiv.org/content/10.64898/2026.02.10.26345995v1.
[11]Liang W J, Tian W W, Wang Y F, et al. Classification prediction of pancreatic cystic neoplasms based on radiomics deep learning models[J]. BMC Cancer, 2022, 22(1): 1237.
[12]Cao K, Xia Y D, Yao J W, et al. Large-scale pancreatic cancer detection via non-contrast CT and deep learning[J]. Nat Med, 2023, 29(12): 3033-3043.
[13]Yuan X H, Chen C W, Shi Z, et al. Deep learning CT model for stratified diagnosis of pancreatic cystic neoplasms: multicenter development, validation, and real-world clinical impact[J]. NPJ Digit Med, 2025, 8(1): 609.
[14]Balakrishnan G, Zhao A, Sabuncu M R, et al. VoxelMorph: a learning framework for deformable medical image registration[J]. IEEE Trans Med Imaging, 2019, 38(8): 1788-1800.
[15]He K M, Zhang X Y, Ren S Q, et al. Deep residual learning for image recognition[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). Los Alamitos, CA: IEEE Computer Society, 2016: 770-778.
[16]Huang G, Liu Z, Van Der Maaten L, et al. Densely connected convolutional networks[C]//2017 IEEE Con-ference on Computer Vision and Pattern Recognition (CVPR). Los Alamitos, CA: IEEE Computer Society, 2017: 2261-2269.
[17]Sandler M, Howard A, Zhu M L, et al. MobileNetV2: inverted residuals and linear bottlenecks[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Los Alamitos, CA: IEEE Computer Society, 2018: 4510-4520.
[18]Xie S N, Girshick R, Dollár P, et al. Aggregated residual transformations for deep neural networks[C]//2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). Los Alamitos, CA: IEEE Computer Society, 2017: 5987-5995.
[19]Tan M X, Le Q. EfficientNet: rethinking model scaling for convolutional neural networks[C]//Proceedings of the 36th International Conference on Machine Learning. New York: PMLR, 2019: 6105-6114.

