【协和医学杂志】多模态可解释性模型预测肺癌患者新辅助治疗后病理完全缓解的价值:一项多中心研究
时间:2026-08-09 09:45:22 热度:37.1℃ 作者:网络
深度解析医学证据,lxfs.net为你支撑决策
肺癌是全球发病率和死亡率均居首位的恶性肿瘤[1]。新辅助治疗已逐渐成为肺癌综合治疗的重要策略,其可降低肿瘤负荷、清除微转移灶并改善患者长期预后[2]。随着免疫检查点抑制剂的广泛应用,新辅助化疗联合免疫治疗可显著提高病理缓解率,其中病理完全缓解(pCR)作为重要疗效终点,与患者的生存获益密切相关[3]。而治疗前准确识别潜在获益人群对于优化个体化治疗策略具有重要临床意义[4]。
近年来,数字病理学与人工智能的快速发展使基于全切片图像(WSI)的深度学习分析成为可能,并在肿瘤诊断、疗效评估和预后预测中具有广阔应用前景[5]。WSI不仅可呈现肿瘤细胞形态,还可反映肿瘤微环境的空间异质性,为治疗反应评估提供了丰富信息[6]。同时,临床数据涵盖患者基线特征及治疗背景,与病理图像具有明显互补性。研究表明,多模态融合可进一步提升预测效能[7],主要实现方式包括前期融合、交叉融合及决策级融合等[8]。
然而,其黑箱特性使其在临床高风险决策场景中的应用受到一定限制[9]。目前,可解释性人工智能成为解决上述问题的重要手段。基于注意力机制的热图可直观定位WSI中的关键病理区域,为病理医师提供了形态学依据[5]。夏普利加性解释(SHAP)方法则可量化各临床特征对预测结果的贡献,揭示特征与结局的关联[10]。因此,将可解释性方法融入多模态模型,对于提升模型可信度和临床应用价值具有重要意义。
目前,针对肺癌新辅助治疗pCR预测的研究仍缺乏同时整合WSI与临床特征并经过多中心验证的可解释性模型。基于此,本研究构建了一个基于决策级融合的多模态可解释性预测模型,并在多中心数据集中验证其性能,通过对WSI与临床分支分别进行可解释性分析,从病理形态与临床特征两个层面阐释模型决策依据,以期为肺癌新辅助治疗疗效分层及个体化决策提供辅助依据。
1 资料与方法
1.1 研究对象
本研究为多中心回顾性研究。回顾性收集2015年3月—2025年3月于河北医科大学第四医院接受新辅助治疗的肺癌患者的临床资料作为内部数据集。
纳入标准:(1)术前临床分期为ⅠB~Ⅲ期肺癌;(2)术前接受至少2个周期的新辅助治疗;(3)具有清晰、完整的WSI资料,且苏木精-伊红(HE)染色切片中存在肿瘤区域。
本研究共采用5次独立重复随机划分实验。每次实验将内部数据集按8∶1∶1的比例随机划分为训练集、验证集和内部测试集。为评估模型在不同中心间的泛化能力,研究另收集同期河北大学附属医院和邯郸市第一医院的患者资料,作为两个独立的外部验证集,纳入标准同内部数据集。
1.2 方法
1.2.1 临床数据收集
患者临床病理资料包括性别、年龄、吸烟史、肿瘤原发部位等。所有病例的病理结果由2名具有10年以上工作经验的病理医师独立评估,若意见出现分歧,经共同讨论后达成一致,若仍存在争议,则由第3名拥有20年以上工作经验的资深病理学专家进行最终判定。pCR定义为:新辅助治疗后瘤床内及区域淋巴结内均未检出残存活肿瘤细胞。
1.2.2 WSI的制备与数字化
所有活检组织处理均遵循标准病理学流程。组织经10%中性福尔马林充分固定后,依次进行脱水、透明、石蜡包埋处理。使用切片机连续切片,厚度为4 μm,经HE染色后封固。采用江丰全自动数字切片扫描仪(KF-SCAN-PL)完成数字化扫描,所有切片均在40倍物镜放大倍数下进行全视野、高分辨率采集,生成的WSI统一保存为“.svs”格式。所有WSI均由2名具有10年以上工作经验的病理医师进行独立质量评估,确认切片中包含明确肿瘤区域、染色均匀、无折叠或模糊等影响分析质量缺陷。当2名医师均判定图像质量符合分析要求时,WSI方可纳入后续研究。
1.2.3 多模态模型构建与评估
本研究提出多模态预测病理完全缓解(MP-pCR)模型,旨在整合WSI与结构化临床数据。该框架采用训练与推理分离的设计策略,各模态在训练阶段独立优化,在推理阶段进行决策层融合,以实现多模态信息的有效整合。
在WSI分支中,首先对数字化WSI进行自动预处理。具体步骤:通过Otsu算法对WSI进行二值化处理,并结合形态学闭运算填充组织区域内的孔洞、去除细小噪声,以实现组织区域与背景的精准分离;40倍物理放大倍数下,采用非重叠滑动窗口技术将识别出的组织区域切割为固定尺寸(224×224像素)的图像区块,并自动剔除组织占比低于80%的低质量区块;最终将处理后的区块表征存入HDF5文件中。
为获得最优图像表征,采用基于单分支聚类约束注意力多实例学习(CLAM-SB)分类器系统评估5个先进病理基础模型(CTransPath、Virchow2、H-optimus-0、Phikon-v2及UNI-V2),比较并筛选性能最优的模型作为最终特征提取器,获得每例患者的图像模态预测概率。
在临床分支中,采用极端梯度提升(XGBoost)模型对结构化临床数据进行训练。该模型基于决策树集成学习算法,可有效处理临床变量间的非线性关系与交互作用。通过网格搜索对模型超参数进行优化,最终获得临床模态的预测概率。临床分支与WSI分支在训练阶段完全独立,各自基于数据特性选择最适合的损失函数与正则化策略。
在多模态融合推理阶段,WSI分支与临床分支首先独立输出各自的预测概率分数。针对临床中同一例患者可能存在多张WSI切片的情况,采用平均值法进行患者层级的概率整合。首先,采用WSI分支为每张切片独立计算概率,再通过算术平均值获得该患者图像模态的最终预测分值,随后在决策层采用Logistic回归模型,将WSI与预测分值进行融合,输出最终分类结果。该策略通过训练自动优化各模态的权重分配,以线性加权的方式实现多模态信息的互补整合。本研究统一采用标准概率阈值0.5作为判定pCR的决策截断值,旨在评估模型在标准正负样本判定边界下的基准判别效能。
1.2.4 模型训练与参数设置
本研究设定了统一训练参数,WSI分支基于CLAM-SB框架,采用Adam优化器,学习率为1×10-4,权重衰减为1×10-5,最大训练轮数为200,注意力嵌入维度为512,实例聚类损失权重为0.7,正负类别采样区块数均为8。临床分支基于XGBoost模型,决策树数量为200,最大深度为4,学习率为0.05,子采样比例为0.8,L1和L2正则化系数均为1.0。融合层采用Logistic回归,L2正则化系数为1.0。为保障结果的稳定性,所有实验均固定随机种子(Seed=1)并采用早停机制。
1.2.5 可解释性分析
本研究从WSI与临床信息两个维度对模型进行可解释性分析。为阐明WSI分支模型的决策逻辑并识别对预测pCR至关重要的形态学特征,本研究基于注意力机制生成空间权重热图。具体而言,模型通过CLAM-SB架构中的注意力网络为每个图像块计算经Softmax归一化的注意力分数,该分数定量表征各图像块对最终预测结果的相对贡献度。将注意力值映射回原始图像空间位置,并通过上采样重建至WSI尺度,即可生成综合空间注意力热图。热图中以暖色调(红色)标示的高注意力区域代表与pCR最相关的肿瘤微环境或治疗反应特征。
临床模型可解释性方面,采用SHAP框架对最优临床模型进行解释。该方法基于博弈论原理,可从全局与局部两个层面量化不同特征对模型预测结果的贡献度。在全局层面,通过特征重要性条形图和SHAP值分布蜂窝图,呈现特征的整体影响模式;在局部层面,随机选取代表性样本,借助SHAP力图可视化不同特征对个体预测结果的具体影响方向及程度。
1.3 样本量估算
本研究为探索性分析,未进行正式样本量估算。内部数据集纳入676例,其中pCR阳性175例(25.9%),符合预测模型构建中阳性事件数≥10倍预测变量的经验要求。外部验证集样本量受限于数字病理切片存档可及性,虽规模有限,但仍可为模型泛化能力提供初步评价。
1.4 统计学处理
所有统计学分析均采用R软件(版本4.4.1)及Python(版本3.10)完成。对连续变量进行正态性检验,符合正态分布的数据以

表示,多组间比较采用单因素方差分析;符合偏态分布的数据以M(P25,P75)表示,多组间比较采用Kruskal-Wallis H检验;分类变量以频数(百分数)表示,组间比较采用卡方检验或Fisher精确概率法。
绘制受试者操作特征(ROC)曲线,采用曲线下面积(AUC)评价各模型的整体预测效能,并计算准确率、灵敏度、特异度、F1分数及Brier分数,以多维度评估模型的判别能力与校准度。针对5次重复随机拆分实验,模型各项性能指标均取5次实验结果的平均值进行报告,并以第1次随机拆分实验为基准,采用Bootstrap方法(重采样1000次)计算得出95% CI。采用DeLong检验比较不同模型的AUC值。双侧检验,以P<0.05为差异具有统计学意义。
2 结果
2.1 一般临床资料
本研究共纳入728例接受新辅助治疗的肺癌患者。其中,内部数据集(n=676)来源于河北医科大学第四医院(1560张WSI),将其随机分为训练集(n=536)、验证集(n=70)及内部测试集(n=70)。河北大学附属医院的32例患者(32张WSI)为外部验证集1,邯郸市第一医院的20例患者(20张WSI)为外部验证集2。研究对象纳入流程见图1。

图1 患者筛选流程图
HE:苏木精-伊红
内部数据集患者平均年龄(60.9±8.2)岁,男性占76.2%(515/676),有吸烟史者占66.6%(450/676),病理类型以鳞状细胞癌[345例(51.0%)]和腺癌[258例(38.2%)]为主,组织学分级以3级(低分化)为主[466例(68.9%)],术前治疗方案以单纯化疗[305例(45.1%)]和化疗联合免疫治疗[316例(46.7%)]为主,临床分期以N2期[381例(56.4%)]患者占比最高,T2期[282例(41.7%)]次之。内部数据集pCR率为25.9%。
各数据集的基线临床特征见表1。不同数据集肿瘤-间质比例(P=0.466)、肿瘤浸润淋巴细胞密度(P=0.358)、肿瘤细胞占比(P=0.119)、间质成分占比(P=0.861)、坏死占比(P=0.503)、pCR率(P=0.146)及组织学分级(P=0.793)等指标差异均无统计学意义。不同数据集年龄(P<0.001)、病理诊断(P=0.031)及临床N分期(P=0.032)等一般资料差异具有统计学意义,客观反映了不同医疗中心临床实践的真实异质性,有助于验证模型的泛化性能。
表1 不同数据集临床资料比较


2.2 模型预测结果
在内部数据集的WSI分支上,基于CLAM-SB框架比较5个病理基础模型的预测效能(表2)。UNI-V2模型AUC为0.774(95% CI:0.688~0.861),准确率为72.7%,特异度达80.0%。尽管在固定阈值(0.5)下,其灵敏度与F1分数均低于部分模型,但考虑AUC评价了模型在全阈值范围内的综合判别效能,且其AUC优于CTransPath(P<0.001)及Virchow2(P=0.038),故选择UNI-V2作为最终特征提取器。
表2 基于CLAM-SB框架的不同病理基础模型在内部测试集中的性能比较

基于上述图像特征,进一步构建临床分支XGBoost模型,并采用决策层Logistic回归融合构建MP-pCR多模态模型。
在内部测试集中,MP-pCR多模态模型的AUC为0.812,高于WSI分支模型(AUC=0.774,P=0.028)和临床分支模型(AUC=0.780,P=0.044),准确率为81.8%,灵敏度为70.6%,特异度为86.5%,Brier分数为0.125。结果表明,多模态融合策略能有效整合病理图像与临床信息,预测性能在统计学方面优于单模态模型。
在外部验证集1中,MP-pCR多模态模型的AUC为0.746,准确率为75.0%,灵敏度为35.0%,特异度为89.3%,Brier分数为0.084。该模型的灵敏度受限于阳性样本数量而偏低,但特异度保持较高水平,且Brier分数表现良好,提示模型概率预测较为准确。
在外部验证集2中,MP-pCR多模态模型的AUC为0.722,准确率为80.0%,灵敏度为78.6%,特异度为80.0%,F1分数为64.7%,Brier分数为0.135。模型各项指标置信区间较宽,但融合后仍较单模态模型有所提升。各模型在3个数据集上的预测性能见表3,性能指标及95% CI均基于5次随机拆分实验结果的均值及汇总分布计算。ROC曲线及校准曲线见图2。

图2 MP-pCR模型在3个数据集中预测pCR的ROC曲线及校准曲线
A.MP-pCR模型在内部测试集中预测pCR的ROC曲线;B.MP-pCR模型在外部验证集1中预测pCR的ROC曲线;C.MP-pCR模型在外部验证集2中预测pCR的ROC曲线;D.MP-pCR模型在3个数据集中的校准曲线
ROC:受试者操作特征;pCR:同表1;MP-pCR:同表3
2.3 可解释性分析
基于多中心数据集的注意力热图分析显示,模型核心关注区域稳定聚集于肿瘤实质部位,并能灵敏捕捉与疗效评估密切相关的病理特征,如肿瘤-间质界面,见图3。

图3 不同测试集病理图片注意力热图
A.内部测试集;B.外部验证集1;C.外部验证集2
在空间分布方面,模型表现出良好的特征判别能力,可有效区分肿瘤细胞巢、正常组织、间质及非特异性炎症反应区。在新辅助治疗前的活检样本中,预测pCR与非pCR患者的热图模式呈现一定差异。非pCR患者的注意力集中于肿瘤实质区域,表现为对不规则巢团状或条索状浸润的肿瘤细胞巢的识别,见图3A。
相比之下,pCR患者的热图分布表现出更强的空间异质性与分散性,关注区域不仅涵盖肿瘤实质区域,且在一定程度上分布于肿瘤-间质交界区,见图3B、3C。
在此区域,肿瘤周边伴丰富的成纤维细胞增生及较高密度淋巴细胞浸润。模型对低分化鳞状细胞癌区域(红色)赋予极高的注意力权重,而对非特异性淋巴细胞集聚区(蓝色)关注度较低,表明模型对当前肿瘤形态具有一定识别能力,而非受背景噪声驱动,其决策逻辑与病理医师的阅片习惯契合。模型对pCR患者表现出的分散性热图特征提示,其可识别有利于免疫应答的微环境模式。这一发现从形态学层面进一步验证了模型的可解释性,即达到pCR的结局不仅取决于肿瘤实质状态,还可能与肿瘤实质及其周围间质共同构成的免疫微环境特征密切相关。
基于内部测试集数据绘制特征重要性条形图与SHAP蜂群图。条形图显示,对pCR预测贡献位居前5位的变量依次为术前治疗方案、病理诊断、肿瘤-间质比例、年龄及吸烟史(图4A)。蜂群图中纵轴的各预测变量颜色由蓝色(低值)渐变为红色(高值),见图4B。

图4 临床特征SHAP可解释性分析
A.特征重要性条形图;B.SHAP蜂群图
SHAP:夏普利加性解释
SHAP分析结果显示,不同术前治疗方案对预测结果的影响存在差异,其中化疗联合免疫治疗及靶向治疗的SHAP值多为正值,推动预测向pCR方向偏移;而单纯化疗的SHAP值多为负值,推动预测向非pCR方向偏移。在病理诊断方面,鳞状细胞癌的SHAP值多为正值,推动预测向pCR方向偏移;腺癌的SHAP值多为负值,推动预测向非pCR方向偏移。年龄作为连续变量,取值较高时SHAP值多为正值,推动预测向pCR方向偏移。
3 讨论
本研究构建并验证了融合WSI与临床特征的多模态可解释性模型MP-pCR预测肺癌新辅助治疗后pCR的效能,结果表明,MP-pCR模型在内部测试集(AUC=0.812)及两个独立外部验证集(AUC分别为0.746和0.722)中均展现出稳健的预测性能,且优于单一WSI或临床模型。可解释性分析进一步揭示,决策层Logistic模型与临床病理诊断高度一致,WSI分支的注意力稳定聚焦于肿瘤实质区域;临床分支中,术前治疗方案、病理诊断、肿瘤-间质比例等特征对预测结果贡献较大。
3.1 模型构建与性能评价
本研究基于多中心肺癌新辅助治疗队列构建了整合WSI与临床特征的多模态预测模型MP-pCR,并在内部测试集及2个外部验证集中系统评估其性能。在WSI分支的病理基础模型筛选中,UNI-V2[11]模型表现相对较优,AUC为0.774,高于CTransPath[12](0.664)、Virchow2[13](0.743)、H-optimus-0[14](0.754)及Phikon-V2[15](0.763)。UNI-V2作为基于DinoV2[16]框架训练的自蒸馏模型,在大规模多中心病理数据中进行预训练,能提取更具泛化能力的病理形态学特征。研究提示,基于大规模病理数据预训练的基础模型具有学习更稳定、更具迁移性的视觉表征,在WSI相关预测任务中具有重要应用前景[17-18]。
在内部测试集中,MP-pCR模型的AUC为0.812,高于WSI单模态模型(0.774)与临床单模态模型(0.780),准确率、灵敏度及特异度分别为81.8%、70.6%和86.5%,Brier分数为0.125,表明多模态融合策略可有效整合病理图像与临床信息的互补优势[19-21]。
在外部验证集1中,MP-pCR模型展现出较高的特异度(89.3%),但灵敏度(35.0%)偏低。除阳性样本量过少导致的统计学数据波动原因外,也存在跨中心验证中不可避免的“域偏移”问题,各医疗中心在HE染色工艺及扫描设备上存在物理差异,导致图像在色彩饱和度及组织透明度上呈现异质性,进而干扰形态学特征的稳定提取。在外部验证集2中,MP-pCR模型的AUC为0.722,准确率80.0%,灵敏度78.6%。虽然2个外部验证集样本量较小,置信区间较宽,但模型依旧展现出一定泛化能力。
针对中心间染色差异引发的“域偏移”挑战,本研究选用的UNI-V2基础模型展现出一定色彩鲁棒性。此外,随着全切片尺度基础模型的出现[22],通过海量异质数据预训练可有效捕捉病理切片中的全局空间特征,从而部分抵消染色偏倚。在模态协同维度方面,Hou等[23]提出的临床信息提示集成框架,通过将临床指标转化为引导模型关注特定病理表型的提示,实现了更深度的语义对齐。
未来研究可借鉴此类提示学习机制或领域对抗学习,以进一步提升模型在极端不平衡数据下的预测稳定性。在融合策略方面,本研究采用决策层Logistic回归融合实现多模态信息的有效整合。根据Cui等[24]与Liang等[25]系统总结,相较于早期特征拼接,决策融合在模块独立性和任务可解耦性方面具有一定优势,能避免多模态间的特征遮蔽效应,确保各分支结果的可解释性,使模型的决策过程更契合临床医师的逻辑习惯。
3.2 模型可解释性分析
多模态深度学习模型的黑箱特性是制约其临床转化的重要障碍[26]。本研究从WSI与临床特征两个维度对模型进行可解释性分析,以增强模型决策的透明度与可信度[27]。
在WSI分支方面,基于注意力机制生成的空间热图显示,模型核心关注区域稳定集中于肿瘤实质部位,并能同步捕捉与疗效评估相关的肿瘤周边区域[28]。低分化鳞状细胞癌区域(红色)获得较高的关注度,而淋巴细胞区域(蓝色)关注度较低,表明模型能精准识别具有诊断与预测价值的结构。该注意力分布模式与临床病理医师的阅片逻辑高度一致。基于注意力机制的可解释性分析可有效揭示模型所关注的病理形态学特征。
在临床分支方面,采用SHAP方法量化各临床特征对模型预测结果的贡献度[29]。特征重要性排序显示, pCR预测贡献排名前5位的变量依次为术前治疗方案(|SHAP|值=0.790)、病理诊断(|SHAP|值=0.450)、肿瘤-间质比例(|SHAP|值=0.256)、年龄(|SHAP|值=0.252)及吸烟史(|SHAP|值=0.207)。
SHAP蜂群图进一步揭示了特征取值与预测结果的关联,术前治疗方案的重要性明显高于其他特征,表明治疗策略是决定新辅助治疗疗效的核心因素。其中化疗联合免疫治疗及靶向治疗从真实世界数据层面验证了其对pCR的正向贡献和优势地位[30-32]。病理诊断可反映不同组织学类型对免疫化疗的应答存在本质差异。鳞状细胞癌较腺癌更易获得pCR。肿瘤-间质比例(|SHAP|值=0.256)可反映肿瘤微环境构成特征。年龄的正向SHAP值可能与高龄患者经过严格筛选、治疗选择更为审慎有关;吸烟史的负向贡献则提示吸烟对疗效的影响可能通过多途径实现,需结合分子亚型进一步解析。
本研究存在一定局限性:第一,尽管纳入多中心数据,但外部验证集样本量较小,导致模型性能指标的95% CI较宽,尤其影响灵敏度的稳定性。未来需进一步扩大外部验证样本量,以更全面地评估模型的泛化能力。第二,本研究为回顾性设计,可能存在一定选择偏倚,后续需开展前瞻性研究以验证模型的临床实用价值。第三,临床分支仅纳入常规临床病理变量,未整合基因组学、蛋白组学等高维分子特征,而整合多组学特征与病理图像的多模态融合策略被证实可进一步提升预后预测精度。因此,未来研究应考虑纳入更多新兴生物标志物以优化模型性能[33-34]。
综上所述,本研究成功构建了可预测肺癌新辅助治疗后pCR的多模态融合模型MP-pCR,其预测性能优于单模态模型,并在外部验证中展现出一定泛化能力,并通过注意力热图与SHAP分析,从病理形态与临床特征层面阐释了模型的决策依据,增强了模型的可解释性与临床可信度。因此,MP-pCR模型有望为肺癌新辅助治疗的疗效分层与个体化决策提供参考依据。
参考文献
[1]Huang J J, Deng Y Y, Tin M S, et al. Distribution, risk factors, and temporal trends for lung cancer incidence and mortality: a global analysis[J]. Chest, 2022, 161(4): 1101-1111.
[2]Liu W Y, Sui Z L, Wang C G, et al. Nomogram for predicting pathological complete response to neoadjuvant chemoimmunotherapy in patients with resectable non-small cell lung cancer[J]. Front Cell Dev Biol, 2025, 13: 1679782.
[3]Banna G L, Passiglia F, Colonese F, et al. Immune-checkpoint inhibitors in non-small cell lung cancer: a tool to improve patients' selection[J]. Crit Rev Oncol Hematol, 2018, 129: 27-39.
[4]Carter L, Apte V, Shukla A, et al. Stage 3 N2 lung cancer: a multidisciplinary therapeutic conundrum[J]. Curr Oncol Rep, 2024, 26(1): 65-79.
[5]Lu M Y, Williamson D F K, Chen T Y, et al. Data-efficient and weakly supervised computational pathology on whole-slide images[J]. Nat Biomed Eng, 2021, 5(6): 555-570.
[6]Coudray N, Ocampo P S, Sakellaropoulos T, et al. Classification and mutation prediction from non-small cell lung cancer histopathology images using deep learning[J]. Nat Med, 2018, 24(10): 1559-1567.
[7]Acosta J N, Falcone G J, Rajpurkar P, et al. Multimodal biomedical AI[J]. Nat Med, 2022, 28(9): 1773-1784.
[8]Liu T Y, Huang T L, Ding T, et al. Leveraging multi-modal foundation models for analysing spatial multi-omic and histopathology data[J/OL]. Nat Biomed Eng,2026. https://doi.org/10.1038/s41551-025-01602-6.
[9]Barredo Arrieta A, Díaz-Rodríguez N, Del Ser J, et al. Explainable artificial intelligence(XAI): concepts, taxono-mies, opportunities and challenges toward responsible AI[J]. Inf Fusion, 2020, 58: 82-115.
[10]Lundberg S M, Lee S I. A unified approach to interpreting model predictions[J]. Adv Neural Inf Process Syst, 2017, 30: 4765-4774.
[11]Chen R J, Ding T, Lu M Y, et al. Towards a general-purpose foundation model for computational pathology[J]. Nat Med, 2024, 30(3): 850-862.
[12]Wang X Y, Zhao J H, Marostica E, et al. A pathology foundation model for cancer diagnosis and prognosis prediction[J]. Nature, 2024, 634(8035): 970-978.
[13]Vorontsov E, Bozkurt A, Casson A, et al. A foundation model for clinical-grade computational pathology and rare cancers detection[J]. Nat Med, 2024, 30(10): 2924-2935.
[14]Saillard C, Jenatton R, Llinares-López F, et al. H-optimus-0[EB/OL].[2026-03-01]. https://githu.com/bioptimus/releases/tree/main/models/h-optimus/v0.
[15]Filiot A, Jacob P, Mac Kain A, et al. Phikon-v2, a large and public feature extractor for biomarker prediction[DB/OL]. (2024-09-13)[ 2026-03-01]. https://doi.org/10.48550/arXiv.2409.09173.
[16]Oquab M, Darcet T, Moutakanni T, et al. DINOv2: learning robust visual features without supervision[DB/OL]. (2023-04-14)[ 2026-03-01]. https://arxiv.org/abs/2304.07193.
[17]Xiang J X, Wang X Y, Zhang X M, et al. A vision-language foundation model for precision oncology[J]. Nature, 2025, 638(8051): 769-778.
[18]Ding T, Wagner S J, Song A H, et al. A multimodal whole-slide foundation model for pathology[J]. Nat Med, 2025, 31(11): 3749-3761.
[19]Han D, Li H, Zheng X, et al. Whole slide image-based weakly supervised deep learning for predicting major pathological response in non-small cell lung cancer following neoadjuvant chemoimmunotherapy: a multicenter, retrospective, cohort study[J]. Front Immunol, 2024, 15: 1453232.
[20]Ye G C, Wu G Y, Qi Y, et al. Non-invasive multimodal CT deep learning biomarker to predict pathological complete response of non-small cell lung cancer following neoadjuvant immunochemotherapy: a multicenter study[J]. J Immunother Cancer, 2024, 12(9): e009348.
[21]Gan X F, He J Z, Zhang W, et al. Attention-guided framework for integrative omics and temporal dynamics in predicting major pathological response in neoadjuvant immunochemotherapy for NSCLC[J]. J Immunother Cancer, 2025, 13(10): e012526.
[22]Xu H W, Usuyama N, Bagga J, et al. A whole-slide foundation model for digital pathology from real-world data[J]. Nature, 2024, 630(8015): 181-188.
[23]Hou J X, Zhang R R, Xie Y Q, et al. Multimodal deep learning for cancer prognosis prediction with clinical information prompts integration[J]. NPJ Digit Med, 2025, 9(1): 76.
[24]Cui C, Yang H C, Wang Y H, et al. Deep multimodal fusion of image and non-image data in disease diagnosis and prognosis: a review[J]. Prog Biomed Eng(Bristol), 2023, 5(2): 022001.
[25]Liang P P, Zadeh A, Morency L P. Recent trends in multimodal machine learning: principles. challenges, and open questions[J]. Proc IEEE, 2024, 112: 557-603.
[26]Topol E J. High-performance medicine: the convergence of human and artificial intelligence[J]. Nat Med, 2019, 25(1): 44-56.
[27]Van Der Laak J, Litjens G, Ciompi F. Deep learning in histopathology: the path to the clinic[J]. Nat Med, 2021, 27(5): 775-784.
[28]Mcgenity C, Clarke E L, Jennings C, et al. Artificial intelligence in digital pathology: a systematic review and meta-analysis of diagnostic test accuracy[J]. NPJ Digit Med, 2024, 7(1): 114.
[29]Lundberg S M, Erion G, Chen H, et al. From local explanations to global understanding with explainable AI for trees[J]. Nat Mach Intell, 2020, 2(1): 56-67.
[30]Forde P M, Spicer J, Lu S, et al. Neoadjuvant nivolumab plus chemotherapy in resectable lung cancer[J]. N Engl J Med, 2022, 386(21): 1973-1985.
[31]Micke P, Strell C, Mattsson J, et al. The prognostic impact of the tumour stroma fraction: a machine learning-based analysis in 16 human solid tumour types[J]. EBio Medicine, 2021, 65: 103269.
[32]Pahud De Mortanges A, Luo H Z, Shu S Z, et al. Orchestrating explainable artificial intelligence for multimodal and longitudinal data in medical imaging[J]. NPJ Digit Med, 2024, 7(1): 195.
[33]Chen R J, Lu M Y, Williamson D F K, et al. Pan-cancer integrative histology-genomic analysis via multimodal deep learning[J]. Cancer Cell, 2022, 40(8): 865-878.e6.
[34]Geng Z H, Li K, Mei P Y, et al. Multichannel deep learning prediction of major pathological response after neoadjuvant immunochemotherapy in lung cancer: a multicenter diagnostic study[J]. Int J Surg, 2025, 111(10): 6614-6626.

