【BCD】CAR T细胞治疗后的毒性预测模型:挑战与机遇
时间:2026-08-24 23:32:49 热度:37.1℃ 作者:网络
深度解析医学证据,lxfs.net为你支撑决策
嵌合抗原受体(CAR)T 细胞疗法应用日益广泛,其适应症已超出血液系统恶性肿瘤。整合了生物标志物和临床变量的预测模型正越来越多地被用于预测 CAR T 细胞治疗后的潜在毒性。然而,由于患者群体和细胞治疗产品的异质性、该领域快速发展的性质,以及炎症性毒性管理的不断进步,CAR T 细胞治疗中的建模面临重大挑战。
《Blood Cancer Discovery》一篇综述回顾了现有为 CAR T 细胞治疗领域开发的毒性预测模型,并指出了其应用中的优势和挑战。作者认为,预测性建模方法为风险分层指导和临床决策提供了潜力,但样本量小、过拟合和数据质量差限制了模型的可重复性和广泛采用。随着 CAR T 细胞疗法应用的扩大,识别其他生物标志物、开发情境特异性模型、标准化新出现毒性的指南,以及利用联邦学习(federated learning)促进协作数据共享将变得至关重要。

引言
嵌合抗原受体(CAR)T 细胞在治疗复发或难治性(R/R)B 细胞血液系统恶性肿瘤方面非常有效。截至 2026 年 1 月,美国食品药品监督管理局(FDA)已批准七种产品用于 B 细胞急性淋巴细胞白血病(B-ALL)、非霍奇金淋巴瘤(NHL)和多发性骨髓瘤。目前正在进行的努力旨在减少毒性、提高缓解率、增强长期缓解,并将 CAR T 细胞推向更早的治疗线。由于多种既定(例如,疾病负荷、既往治疗和 T 细胞适应性)和新兴因素影响个体患者 CAR T 细胞治疗的总体成败,建立稳健的预测模型已成为优化候选者选择、减轻或规划毒性以及更好地告知患者的优先事项。理想情况下,这些模型需要 (i) 具有临床信息量和相关性(即解决重要且可操作的临床挑战),(ii) 准确且高效(即具有高预测或区分精度,而无需过多的时间或计算资源),以及 (iii) 稳健且可推广(即能够处理噪声或异常值,并在外部队列中得到验证)。
包含广泛变量的众多预测模型已经出现,以帮助指导决策,这些模型利用基线合并症、实验室值和生物标志物、影像学特征和/或疾病特征来预测临床结局。尽管解决了未满足的需求,但已发表模型的激增造成了关于使用哪种模型以及何时使用的不确定性,以及对它们具体适用性的担忧。在这个不断发展的领域,毒性管理策略已经从反应性方法转变为早期干预或预防性的方法,并且在优化患者接受 CAR T 细胞的专业知识正在增加,此时应用这些模型可能变得具有挑战性——特别是 “一刀切”策略已经不适用于将特定模型用于特定患者、疾病或 CAR T 细胞结构。
本文回顾了已验证的用于预测 CAR T 细胞炎症性毒性和生存的模型,并讨论了模型开发中的关键考虑因素、挑战和潜在解决方案。
CAR T疗法的演变状态
CAR T 细胞疗法可引起独特的炎症性毒性,包括细胞因子释放综合征(CRS)、免疫效应细胞相关神经毒性综合征(ICANS)、免疫效应细胞相关噬血细胞性淋巴组织细胞增生症样综合征(IEC-HS)和免疫效应细胞相关血液毒性(ICAHT)等。这些毒性的定义和分级量表随着更多的治疗经验而演变,使得协调它们变得具有挑战性。在 2019 年美国移植与细胞治疗学会(ASTCT)旨在统一定义的共识指南发布之前,不同的 CRS 和神经毒性(现为 ICANS)分级系统使得跨机构比较毒性变得困难。类似地,相对较新建立的 ICAHT 和 IEC-HS 的回顾性应用可能受到限制。
自 2017 年 FDA 首次批准 CAR T 细胞用于治疗 B-ALL 以来,我们对与不良结局和毒性缓解相关的风险因素的理解已经演变(图 1)。例如,输注前的高疾病负荷通常与更差的结果相关,包括 CRS 和 ICANS 发生率增加、严重 CRS 发生率更高,以及缓解率和总生存期(OS)较差。这影响了 CAR T 细胞接受者的选择,并为用于 CAR T 细胞输注前减瘤的桥接治疗方法提供了信息。因此,输注时的疾病负荷普遍下降,并且随着患者人口统计特征的变化,依赖疾病状态的模型适用性可能会降低。

图1.CAR T细胞疗法开发和临床实施的关键里程碑时间表,包括首次临床使用、监管批准以及毒性定义/指南和管理的重大发展
在管理方面,虽然早期临床试验将毒性导向干预限制在治疗更严重的毒性上,但该领域已迅速发展为纳入早期干预(在初始发作后防止发展成更严重的毒性)甚至预防性(在毒性发生之前就防止其发展)方法,因为新兴数据支持通过限制毒性严重程度来维持(甚至增强)CAR T 细胞疗效。例如,托珠单抗在早期实践中并不常规使用,直到有证据表明它不影响 CAR T 细胞疗效。各机构在 CRS 和 ICANS 管理上的差异,包括使用托珠单抗或皮质类固醇的阈值,可能会通过引入毒性治疗方式的不一致性来影响模型准确性。此外,更早和更有效的干预措施可能会改变自然进程并降低这些并发症的严重程度。
因此,在一个实时方法积极(且有效地)寻求减少毒性的不断发展的时代,建立模型来预测正在演变的结果可能具有挑战性。例如,在导致 axicabtagene autoleucel(axi-cel)获批用于成人 R/R 大 B 细胞淋巴瘤(LBCL)的关键性研究中,使用早于 ASTCT 共识指南的分级标准,严重(≥3 级)CRS 和神经系统事件的发生率分别为 13% 和 28%。在一个接受 axi-cel 的可比患者队列中,预防性使用地塞米松预防了严重 CRS,并将严重神经系统毒性的发生率显著降低至 13%。因此,在 2022 年,axi-cel 的 FDA说明书纳入了地塞米松以减轻毒性——即使是针对持续性 1 级 CRS,以防止升级为更严重的 CRS。
重要的是,CAR 构建体设计和靶向疾病的差异在治疗结果中也起着关键作用。例如,不同的共刺激结构域(即 CD28 与 4-1BB)可能影响 CAR T 细胞扩增的动力学和炎症性毒性的时间/严重程度。疾病类型(例如,NHL 与多发性骨髓瘤与 B-ALL)也可能与基线实验室检查结果(例如,血细胞减少症)和合并症(例如,年龄或既往严重感染)的差异相关。最后,尽管所有 FDA 批准的 CAR T 细胞构建体都靶向 CD19 或 B 细胞成熟抗原以治疗 B 细胞恶性肿瘤,但其他抗原靶点和疾病 [例如实体瘤或自身免疫性疾病] 可能产生不同的毒性特征和时间线。
开发预测模型的关键考虑因素
预测模型使用历史数据来预测未来结果,它们成功的临床应用取决于高质量的数据、准确且可推广的性能、稳健的验证以及可解释且可操作的风险估计。
开发预测工具的一个重要考虑因素为选择其组成部分,特别是生物标志物;这些生物标志物可以用于诊断、预后和/或预测目的。对于生物标志物在临床上要有用并为治疗决策提供信息,它应满足三个关键标准:分析有效性(可靠且可重复的测量)、临床有效性(能够准确地对患者进行分层)和临床效用(使用临床可获取和可测量的特征,证明其具有改善患者结局的能力)。预测性生物标志物不仅应显示与结局有显著关联,还应以高灵敏度和特异性准确预测结果。
预测模型的性能不仅取决于其架构,还取决于仔细的评估,应考虑区分度和校准。区分度是指模型区分哪些患者会发生结果的能力,通常使用受试者工作特征曲线下面积(AUC)来衡量。AUC 为 0.5 表示无区分能力,等同于随机概率,而 AUC 为 1 表示完全区分,意味着所有发生结果的患者都被分配了比未发生结果者更高的预测风险(图 2)。

图2.开发基于 AI的预测模型的关键考虑因素。区分度是指模型区分出现结局和未出现结局的患者的能力,通常通过 AUC定量。校准反映了预测和观察风险之间的一致性,可通过大型校准(系统性过度预测或预测不足;目标值 = 0)和校准斜率(预测风险相对于观察结果的分布;目标值为1)进行总结。当模型过度定制训练数据时,会出现过度拟合,导致对验证(看不见的)数据进行评价时,辨别能力下降和特征误校准(如斜率夸大或 S形偏差)。
用于评估区分度的其他指标包括灵敏度、特异性、阳性预测值、阴性预测值和准确性。校准评估预测风险与观察到的风险/结果之间的一致性,可以通过校准截距(评估预测风险总体上是过高还是过低,目标值为 0)和校准斜率(衡量预测风险相对于观察结果的离散程度,目标值为 1)来量化。校准不良可能导致系统性的过度治疗或治疗不足,而区分度差则会导致对错误个体进行治疗。重要的是,区分度的改善并不能保证校准或临床效用的改善,这强调了评估这两个指标的重要性,特别是当预测风险用于指导预防性或早期干预方法时。例如,一个模型可能通过准确地将患者从最低到最高 CRS 风险排序而具有良好的区分度,但如果高风险患者被预测有 80% 的 CRS 机会,而实际上该组中只有 30% 发生 CRS,则其校准度会很差。反之,一个模型可能校准良好但区分度差——例如,预测 30% 的 CRS 风险与实际发生率相符(良好校准),但无法区分哪些患者会发生 CRS(区分度差;图 2)。
过拟合(Overfitting)仍然是一个主要问题,特别是在队列小且结果事件有限的 CAR T 细胞研究中。当模型过于紧密地针对独特的训练数据定制,随后无法推广到新的或未见数据时,就会发生过拟合(图 2)。不完整的数据、不一致的测量实践和有偏见的注释进一步增加了这种风险。数据质量差可能源于缺失数据字段,或不同机构间缺乏标准化和测量方法或协议。减轻过拟合的策略包括诸如 k 折交叉验证、正则化技术 [例如,最小绝对收缩和选择算子(LASSO)和岭回归] 以及在多样化数据集上训练等方法。正确地将数据划分为训练集和验证集可以减少过拟合并增强模型泛化能力。然而,对于小样本量,拆分数据可能会增加过拟合的风险;在这种情况下,合并数据并应用内部验证通常更可取。在评估模型的广泛适用性时,重复测试和使用未见数据进行验证非常重要。决策曲线分析有助于区分使用该模型是否能提供净收益。
开发基于人工智能的预测模型的关键考虑因素
除了传统的统计方法外,基于人工智能(AI)的方法也为 CAR T 细胞治疗中的预测建模提供了重要优势,因为其结果是由患者因素、疾病生物学、治疗特征和支持治疗之间复杂且通常非线性的相互作用驱动的。传统的回归模型依赖于变量之间预定义的关系,并且通常假设线性效应,这可能无法充分代表 CAR T 细胞治疗的生物学和临床复杂性。相比之下,机器学习方法,如基于树的集成、核方法和神经网络,可以在没有明确指定的情况下捕获高阶交互和非线性依赖关系。当实验室生物标志物、疾病负荷、既往治疗、炎症状态、影像学特征和 CAR 构建体相关变量共同影响毒性和生存时,这一点尤其重要。
当输入数据是高维、多模态或纵向的时,AI 方法最有用,例如将结构化电子健康记录数据与序列实验室趋势、细胞因子谱、PET/CT 影像组学和细胞产品属性相结合。在临床数据集中,基于树的集成方法,包括随机森林和梯度提升,通常在表格数据上表现良好,因为它们可以适应非线性效应和缺失值。深度学习方法更适合原始数据,如图像或时间序列信号,但通常需要更大、更协调的数据集,并且更容易受到特定地点伪影的影响。在 CAR T 细胞治疗中,AI 带来附加价值的一些最明显例子来自多变量细胞因子特征,这些特征可在输注后发热期间区分感染与 CRS,在这种情况中,单一生物标志物如 IL6 或 C 反应蛋白(CRP)的特异性有限。同样,PET/CT 影像组学模型利用高维影像特征来预测持久反应和生存,超出了传统 PET 指标的范畴,尽管它们的临床转化受到扫描仪、分割策略和分析流程差异性的挑战。结合互补的预测因子可以进一步提高临床效用。例如,CAR T 特异性国际代谢预后指数(CAR-IMPI)在与 CAR-HEMATOTOX(CAR-HT)和炎症特征(如 INFLAmmation MIXture [InflaMix])整合后性能得到改善,反映了一种复合方法,与临床医生评估肿瘤负荷、宿主储备和全身炎症的方式一致。
相比之下,当样本量有限、预测因子稀疏或关系基本为线性时,更简单的模型可能表现相似,同时提供更好的可解释性和稳健性。因此,模型选择应受到临床问题、数据结构和预期应用的指导,而不仅仅是方法学的复杂性。
个体预后或诊断多变量预测模型透明报告(TRIPOD)指南为开发和报告预测模型提供了一个框架,但最初是为使用回归方法开发的模型创建的。这些指南随后在 AI 方法(尤其是机器学习)使用增加的背景下进行了更新(TRIPOD+AI),以完整且透明地报告开发或评估预测模型的研究。一个重要的补充是强调公平性,以避免基于年龄、性别、种族/民族或社会经济状况对患者的歧视,并在关键亚组中评估模型性能,以最小化偏差并确保目标人群的准确代表性。更新后的指南还强调开放科学实践,并使研究方案、数据和代码可获取,以促进独立测试并提高预测模型的可靠性。
最后,模型可解释性对于临床采用至关重要。高度复杂的模型可能达到优越的表观性能,但有限的透明度可能削弱临床医生的信任、监管接受度和真实世界应用。诸如特征归因、部分依赖分析和事后可解释性方法等方法可以提高可解释性。包括 SHapley Additive exPlanations(SHAP)值、排列重要性和注意力机制在内的工具有助于识别驱动个体风险估计的特征,并允许检测生物学上不合理或不稳定的预测。通过贝叶斯框架或集成建模纳入不确定性估计,进一步帮助临床医生识别预测不可靠而非精确的情况。AI 模型在肿瘤学中的近期失败表明,强大的性能指标本身并不能保证安全性或泛化性。在 CAR T 细胞治疗中,可解释性应被视为负责任的临床转化的先决条件,特别是当模型输出影响治疗顺序或资源分配决策时。
造血细胞移植中的预测模型
预测模型在异基因造血细胞移植(HCT)领域已显示出可靠性和有效性,为 CAR T 细胞治疗中建模的适用性奠定了基础。例如,HCT 合并症指数(HCT-CI)纳入基线合并症,并已被验证可预测接受 HCT 的成人和儿童患者的非复发死亡率(NRM)和 OS。多项研究已证实其在不同移植方案和疾病中的预测准确性。已开发出诸如简化合并症指数等简化版本,其对 NRM 的预测效果至少相当。另一个例子是内皮活化和应激指数(EASIX)评分,计算公式为乳酸脱氢酶(LDH)× 肌酐/血小板,最初设计用于预测 HCT 后的内皮并发症,但也显示出对 NRM 和 OS 的预测价值,并随后在儿童和老年人群中得到验证。
CAR T 细胞疗法中当前的预测模型
以下部分总结了CAR T 细胞治疗中最成熟的部分预测模型,这些模型已在独立队列中验证,用于预测 CRS 和 ICANS、血液毒性、感染和生存(图 3)。

图3.用于预测 CAR T细胞治疗并发症的当前经验证的预测模型。CAR后并发症(例如CRS、ICANS、IEC-HS、中性粒细胞减少症和感染)的代表性患者时间线,是基于输注后第0天至第30天的时间。仅纳入了在独立队列中接受验证的预测模型,示例显示了不同的重大并发症类别
这些模型可以在关键临床决策时间点的背景下进行解释,包括输注前风险分层、输注后早期毒性预测和总体结局。重要的是,并非所有预测问题都同样易于用现有数据处理。输注前风险分层和输注后早期毒性预测,特别是针对更常见的毒性如 CRS、ICANS 和血液毒性,在基线变量和实验室数据常规可用时,相对更具可操作性。相比之下,由于疾病和患者特异性因素的差异,生存结局的预测可能更具挑战性。这也突显了预测模型更容易实施以及需要进一步开发或需要情境特异性模型的情况。
预测 CRS 和 ICANS
CRS 是 CAR T 细胞治疗后最常见的急性毒性,影响绝大多数患者(表 1;因为表1非常长,就不放到公众号,可以去原文看)。
相比之下,神经毒性或 ICANS 较少见,发生率在 23% 至 64% 之间。由于内皮活化被认为在 CRS 和 ICANS 的发病机制中起关键作用,反映内皮活化的标志物,如 LDH 或血小板计数,已被纳入多个预测模型。尽管 LDH 作为内皮活化和疾病负荷的标志物,表明其在风险预测中的实用性,但其在炎症状态和溶血期间的非特异性升高可能限制其在 CAR T 细胞治疗中的预测价值。类似地,CRP 和铁蛋白被常规监测,其基线值可指示既存炎症,但它们在预测 CRS 严重程度方面的效用并不一致。尽管如此,仍有部分模型成功整合了这些实验室标志物中的一种或多种。
最大的努力之一是 CRS 和 ICANS 预后评分系统(PSS),该系统在超过 1600 名 R/R LBCL 患者中推导并验证,分别用于预测 ≥3 级 CRS 和 ICANS。CRP 被纳入 CRS-PSS,而血小板计数被纳入 CRS 和 ICANS 评分系统。其他变量包括性别、桥接治疗或桥接后疾病稳定/进展、大包块疾病以及使用 axi-cel。另一个模型由 390 名 R/R LBCL 患者开发,专注于预测早发性 CRS 或神经毒性,纳入了 CRP、天冬氨酸氨基转移酶(AST)、血红蛋白、>65 岁、既往治疗线数和基线疾病负荷。
总体而言,由于重叠的生物标志物和与 CRS 频繁同时发生, ICANS 特异性工具相对较少。R/R 淋巴瘤患者的多变量评分使用 CRS 发作和严重程度作为 ICANS 的预测因子,但其实时应用可能受限,因为 ICANS 经常与 CRS 重叠或在 CRS 后不久发生。血清神经丝轻链(NfL)水平是一种新兴的 ICANS 生物标志物,反映既存的神经轴突损伤,可能增强早期风险分层。
EASIX 评分及其衍生物
EASIX 评分改编自 HCT,并应用于 CAR T 细胞环境以预测与 CRS 和/或 ICAN 相关的结果。EASIX 模型及其变体利用在清淋(LD)前、输注当天或输注后不久,或在 CRS 发作时获得的 LDH、肌酐、血小板计数、CRP 和铁蛋白的组合,来确定表征内皮功能障碍的评分。这些模型已在 LBCL、B-ALL、慢性淋巴细胞白血病和多发性骨髓瘤的成人和儿童队列中进行了评估。然而,EASIX(或其改良变体)在持续预测 CRS 和 ICANS 的发生率和/或严重程度方面存在显著异质性。最初针对 LBCL 或 B-ALL 成人的研究表明,EASIX 或其变体可预测 CRS 和 ICANS(≥2 或 3 级),但后来的研究显示结果不一。一项研究表明,输注前 EASIX 和简化 EASIX 与 LBCL 患者 ≥3 级 CRS 相关,但在内部验证后失去显著性,并且在多发性骨髓瘤/淀粉样变性队列中未显示关联。尽管这些差异可能反映研究人群和评分计算时间的差异,但 EASIX 在 CAR T 细胞人群中的预测能力可能有限,因为其病理生理学涉及除内皮活化之外的广泛免疫活化。
基于细胞因子的模型
一些模型评估了实时细胞因子谱分析和炎症生物标志物以预测 CRS 或将其与感染区分开来。在 CAR T 输注后的序列分析中,Teachey 及其同事开发了逻辑回归和决策树模型,可预测 ≥4 级 CRS,纳入了疾病负荷和细胞因子,基于 39 至 51 名患者的发现队列和 12 名患者的验证队列。IFNγ 和 sgp130 在最初 3 天内升高,IL6 和 IL8 在 4 至 5 级 CRS 患者中达到的峰值水平高于 1 至 3 级 CRS 患者。尽管 IL6 和 IL8 升高与 CRS 的发生或严重程度有关,但它们在区分 CRS 与感染方面缺乏特异性。Gallo 及其同事证明,与 CRS 相比,败血症的特征是 IFNγ 和 IL10 较低,但 IL6 和 IL8 水平较高。Luo 及其同事发现,IFNγ 水平降低伴 IL8 和 IL1β 升高与严重感染相关,而非 CRS。他们还报道了“IL6 双峰”(CRS 升高后跟随感染驱动的峰值)作为严重感染的特征,突显了细胞因子变化的模式可能比绝对水平提供更多信息。其他模型纳入了额外的细胞因子和生物标志物,包括 IFNβ、IL2、CXCL1、CXCL10 和 GZMB。总体而言,尽管诸如 IL6 和 IL8 等细胞因子在 CRS 期间通常升高,但其模式在不同研究中不一致,并且可能与感染重叠,限制了其孤立预测价值。
此外,尽管细胞因子水平与 CRS 之间存在潜在关联,但基于细胞因子的生物标志物作为早期预测因子的临床效用仍然有限,原因是检测成本高、处理时间长(>24 小时)、平台差异性、缺乏广泛可用性,以及细胞因子水平的快速波动——这可能受到细胞因子导向干预措施的影响。此外,尽管细胞因子谱分析为 CRS 病理生理学提供了生物学见解,但难以标准化,并且大多数早期工作是在小型队列和临床试验及研究相关性的背景下进行的。进一步的研究最终可能提高基于细胞因子特征的细微差别来区分临床相似条件的能力。
预测血液毒性和感染
CAR T 细胞后的血细胞减少症最近被称为 ICAHT(表 1),是另一种显著且常见的不良事件,可使患者易发生严重感染。CAR-HT 是血液毒性的主要预测模型。基于 LBCL 成人训练队列并跨多个中心验证,较高的 CAR-HT 评分可预测严重的长期中性粒细胞减少症和较差的生存率。诸如 ALL-HEMATOTOX(ALL-HT)等模型,根据 B-ALL 的疾病特征差异对 CAR-HT 进行了修改,以及早期 ICAHT 预测模型,将疾病分类(ALL 与其他)作为变量,证明了纳入疾病特异性因素以实现准确的血液毒性风险分层的重要性。
关于感染风险,输注后中性粒细胞减少症是常见的相关因素,此外还有 CRS、ICANS 和皮质类固醇使用。然而,依赖输注后变量的模型的临床效用面临自身挑战。例如,一项研究开发了一个诺模图,纳入 LD 前淋巴细胞百分比(<20%)和 14 天内未使用 G-CSF 来预测 ALL 和 NHL 成人患者 3 个月内的病毒感染。然而由于包含可能直到输注后 2 周才能确定的变量,降低了该模型的临床适用性和预测效用。关于输注前因素,CAR-HT 评分在多个国际队列中可预测严重感染,包括 LBCL、多发性骨髓瘤、套细胞淋巴瘤(MCL)和 B-ALL 患者。HT10 评分结合了 CAR-HT 和发热当天的降钙素原水平,能够在 CRS 情况下识别感染,该评分与输注后最初 30 天内的严重感染风险显著相关。在儿科背景下,降钙素原水平升高与 ≥3 级 CRS、儿科重症监护室入院和死亡率相关,但与血流感染无关。总体而言,感染的预测模型受限于队列疾病异质性、预测生物标志物的不一致性以及纳入输注后变量,大多数验证性研究分析的是成人淋巴瘤患者。
预测 CAR T 细胞治疗后的生存
当前的 CAR T 后生存模型利用包括合并症、免疫或炎症实验室参数、营养状况和影像学特征在内的变量,但主要是在成人淋巴瘤背景下开发的(表2)。

这也代表了其他疾病的一个重要知识空白,因为生存预测对于患者咨询、治疗计划和资源分配至关重要。在 LBCL 和 B-ALL 患者中,LD 前或 CAR T 输注前升高的 LDH 水平和低血小板计数与较差的 OS 相关,但实验室标志物可能非特异性且存在局限性,如前所述。与 CAR T 细胞反应相关的因素包括微小残留病(MRD)、分子疾病特征和 CAR T 细胞特征(例如,CD4+/CD8+ 比值和峰值扩增)。预测复发风险和治疗反应或疗效的模型是一个重要且不断发展的领域,但超出了本综述的范围。
基于合并症的预后模型
Severe4 模型旨在基于严重合并症(使用累计疾病评定量表 [CIRS] 在呼吸、上消化道、肝脏和肾脏系统中的存在)来预测 CAR T 细胞患者的生存。在 R/R LBCL 成人患者中,Severe4(CIRS ≥3)可预测无进展生存期(PFS)、OS 和 ≥3 级 CRS,但不能预测 ≥3 级 ICANS。当评估 CIRS ≥7 时,只有 ≥3 级 ICANS 成为预测结果;该模型失去了预测 PFS 和 OS 的能力。另一项研究发现 CIRS ≥7 可预测 OS,但不能预测 CRS 或 ICANS。
细胞治疗特异性合并症指数(CT-CI)由 951 名患者开发,并在 965 名 LBCL 患者中验证,用于预测 CAR T 细胞后的生存,使用的合并症与 HCT-CI 中使用的相似。与 HCT-CI 类似,CT-CI 评分较高的成年患者具有更差的 OS 和更高的治疗相关死亡率。然而CT-CI 不能预测毒性。
基于免疫或炎症的预后模型
部分模型评估 CAR 前免疫状态和全身炎症作为生存预测因子。一个包含单采时循环 B 细胞和淋巴细胞/单核细胞比率的基线免疫模型预测了 1 年 PFS。一个 LD 前 CRP 和铁蛋白模型将患者分为可预测 ≥3 级 CRS 和 ICANS 以及 PFS 和 OS 的风险组,但只有生存结果在额外的队列中得到了验证。
InflaMix 模型由 149 名 LBCL 患者创建,并在 688 名 LBCL、MCL 和滤泡性淋巴瘤(FL)患者中验证。InflaMix 根据 14 个 CAR 输注前实验室特征(包括血红蛋白、LDH、CRP、白蛋白、碱性磷酸酶和 AST)将患者分为炎症和非炎症聚类。InflaMix 可预测PFS 和 OS,但 MCL/FL 队列中的 OS 除外,但与 ≥2 级 CRS 或 ICANS 无关。淋巴瘤亚型之间的异质性,包括 FL 更惰性的性质,表明进一步的细化或亚型特异性方法可能提高预测准确性。
骨髓瘤 CAR-T 复发(MyCARe)模型,专门为多发性骨髓瘤开发,利用髓外疾病或浆细胞白血病的存在、高风险细胞遗传学、铁蛋白和来那度胺难治性来预测 PFS、OS 和早期复发/进展。
免疫营养预后模型
用于传统癌症治疗的营养评分已被应用于预测 CAR T 细胞治疗中的生存,因为接受 CAR T 细胞治疗的 LBCL 和基线肌肉减少症患者由于 NRM 增加而显示 OS 降低。恶病质或肌肉减少症引起的炎症增加可能影响 CAR 输注时的免疫环境。预后营养指数(PNI),结合白蛋白和总淋巴细胞计数,可在两个成人淋巴瘤队列中预测 PFS 和 OS,但PNI 阈值不同。格拉斯哥预后评分(GPS)基于 CRP 和白蛋白,在几项研究中与较差的 OS 相关,包括 LBCL 和多发性骨髓瘤患者,但两项研究使用了不同的截断值。在 R/R 多发性骨髓瘤患者中,GPS 可预测 ≥3 级 CRS(但不是任何级别CRS)和任何级别ICANS。
基于影像的系统
基于影像的预后模型通常纳入 PET/CT 特征,主要用于淋巴瘤患者,其中影像学对于分期至关重要,这与 B-ALL 或多发性骨髓瘤不同,后者不一致的地方在于涉及髓外疾病。CAR-IMPI 将基于淋巴瘤的指数改编到 CAR T 细胞环境,并纳入年龄、Ann Arbor 分期和 PET/CT 的代谢肿瘤体积来预测 PFS 和 OS,当与 CAR-HT 和 InflaMix 结合时准确性提高。CAR-IMPI 通过合并推导和验证队列应用于毒性结果,显示与 ≥3 级 CRS 和 ICANS 相关。基于 PET 的影像组学评分预测了 PFS 和 OS,但不能预测 ≥2 级 CRS 或 ICANS。Zhou 及其同事开发了使用影像组学特征预测 PFS 和 OS 的诺模图。其他 PET 指标,如最大标准化摄取值(SUVmax)、总病变糖酵解和肿瘤生长速率,也已在预测 CAR 后结局方面进行了探索。尽管基于影像的模型在预测淋巴瘤患者结局方面具有潜力,但由于复杂的公式、可变的阈值和不同的分析平台,影像学衍生的参数和算法难以标准化。
跨模型比较
除了主要结局外,上述部分模型还评估了其评估替代结局的效用。例如,CAR-HT 评分 ≥2 或 3 在多个成人队列中可预测更差的 PFS 和/或 OS。然而在这些队列中,CAR-HT 不能预测 CRS 或 ICANS,除了在多发性骨髓瘤人群中预测 ≥3 级 ICANS 以及在一个 LBCL 队列中预测任何级别的 CRS。尽管部分模型如 EASIX 及其变体可以预测 CRS 和 ICANS,但能够同时预测 CRS 或 ICANS 与血液毒性的已验证模型有限。值得注意的是,改良的 EASIX 在多发性骨髓瘤队列中可预测 ICANS、晚期 ICAHT、PFS 和 OS,Wang 及其同事报告说,更高严重程度的 CRS 与早期造血恢复的可能性较低独立相关。此外,部分模型可能测试了额外结果但未报告,因为阴性结果通常被低估。为一种毒性开发的模型可能不适用于另一种结果,这表明 CAR T 细胞毒性受不同的生物学和患者特异性因素影响。
疾病或年龄特异性模型的需求
目前该领域的大多数预测模型都是基于成人 LBCL 患者队列开发的。然而,年龄或疾病特异性参数(如 B-ALL 中的骨髓浸润或多发性骨髓瘤中的浆细胞负荷)可能会影响既定的血液毒性模型。因此,以 B-ALL 为例,应用现有模型的关键限制概述如下。
CRS/ICANS
最近一项研究发现 EASIX 可预测儿科 B-ALL 患者任何严重程度的 CRS 和 ICANS,但其在该人群中的作用需要进一步探索。鉴于 EASIX 的预测准确性不一,开发了一种新的 CAR 特异性合并症指数(CAR-CI),纳入年龄、既往 HCT、基线骨髓(BM)疾病、肌酐和射血分数。在早期应用中,CAR-CI 与严重 CRS 和 ICANS 相关,但与 CRS 发生率或完全缓解无关。
血液毒性
CAR-HT为成人淋巴瘤开发并在一项成人 B-ALL 研究中验证,由于潜在疾病生物学的差异,需要在儿科或 B-ALL 人群中进一步评估。修改 CAR-HT 评分后,用基线 BM 疾病负荷(以反映基础造血功能而非基线炎症)替代铁蛋白,产生了一个名为 ALL-HT 的新模型,该模型可预测儿童 B-ALL 患者的严重中性粒细胞减少症。这表明最初为预测成人血液毒性而开发的模型不一定适用于儿童和年轻人。预先存在的模型可能需要为特定人群和疾病进行调整或定制。
与成人相似,儿童血液毒性预测模型对于其他 CAR 相关结局往往比 CRS/ICANS 的模型更具泛化性,并且也可能有助于预测生存。预测 CAR T 细胞治疗后 CRS 或 ICANS 的模型可能需要根据年龄、疾病和治疗进行个体化,而不是采用“一刀切”的方法。
生存
尽管 ALL-HT 也与 2 年 OS 相关,但针对接受 CAR T 细胞治疗 B-ALL 的患者,已验证的以生存为重点的模型有限,这也突显了该领域的一个空白。针对 R/R 多发性骨髓瘤患者的 MyCARe 模型是考虑了疾病特异性因素的生存模型的一个例子。需要进一步研究来开发和验证专门针对 B-ALL 的稳健生存预测模型,同时考虑儿童和年轻成人患者独特的因素及其独特的生物学特性。此类模型可显著有助于患者分层和治疗计划。
比较预测建模方法
补充表 S1 比较了各研究中 CAR T 细胞治疗预测模型开发的方法,重点关注表 1 中的 CRS/ICANS 模型,包括基于细胞因子的模型。这些已发表的模型中有许多使用传统的统计方法,如自助法和多变量逻辑回归。相反,部分研究纳入了机器学习方法,如决策树建模、基于随机森林的插补和梯度提升。未来的研究可能受益于更多地利用 AI 方法,特别是在具有复杂、非线性交互的数据集中。
不同模型对缺失数据的处理不一致。部分研究排除了实验室或生物标志物数据不完整的患者,或在多变量分析中将缺失值视为零。一项研究利用随机森林插补,这是一种基于机器学习的方法来估计缺失值。缺乏标准化的缺失数据处理方法可能影响模型的区分度、校准和可重复性。
验证策略在队列规模、随机划分与时间划分的使用,以及内部或外部验证方面各不相同。在进行外部验证的研究中,纳入的患者和中心数量差异很大。尽管一些研究进行了验证,但其中大量模型是在相对较小的队列中验证的。值得注意的是,CRS- 和 ICANS-PSS、CT-CI 和 InflaMix 模型包含一些最大的验证队列。CAR-HT 也因其跨多种疾病、中心和研究的验证而值得注意。这些例子说明了已发表模型在验证规模和方法上的差异,以及在测试预测模型时进行大型、多中心外部验证的重要性。
许多列出的已发表模型报告了区分度的测量,最常见的是 AUC,而非校准度来测试模型性能。校准度评估有限是模型应用于新队列时泛化失败的一个潜在原因。
预测建模的主要挑战及潜在解决方案
CAR T 细胞治疗背景下的预测建模显示出前景,但在实现一致的准确性方面仍面临重大挑战(表 3)。

许多引用的模型同时使用了推导和验证队列,但即使是经过验证的模型(如 EASIX)在外部队列中也表现出性能的不一致性。在一些研究中,验证队列来自同一机构和患者群体,限制了泛化性。此外,CAR 构建体(靶抗原、共刺激结构域和制造工艺)和疾病类型的差异也会影响毒性特征和动力学以及生存结果,引入了额外的变异性。各机构在毒性管理实践方面,包括托珠单抗和皮质类固醇给药的阈值以及支持治疗指南,也可能有所不同,可能导致中心特异性差异,从而降低模型在不同机构的预测性能。这些情况也突显了将预测模型应用于不同人群和环境中的困难。当预测的结果不常见或罕见时,会出现另一个潜在限制,导致事件过少而无法进行有意义的区分。此外,部分模型依赖于无法快速获得的生物标志物或结果,从而限制了实时预测。识别最佳生物标志物对于更好地理解和管理患者预后以及改进模型预测至关重要。随着 CAR T 细胞疗法扩展到更广泛的适应症,并且构建体设计和治疗方法不断发展,预测建模可能会变得更具挑战性,并且可能需要专注于特定的 CAR 构建体/产品或疾病,以实现有意义的预测能力。
另一个关键挑战在于模型的可解释性和纵向更新。为了使预测模型被临床医生广泛采用和信任,其决策过程最好应该是透明、可理解和易于获取的。尽管先进的 AI 模型可能提高表观准确性,但有限的透明度可能阻碍信任和安全监督。最近的努力不仅仅关注模型架构,而是强调以数据为中心的方法,包括改进代表性数据集的策展,以及随着制造工艺、患者选择和支持治疗的演变,系统性地监测数据漂移。因此,持续更新和再验证对于确保长期持续的相关性至关重要。
与此相关的是,模型复杂性必须与透明度、公平性和治理相平衡。事后解释工具和固有的可解释建模策略允许临床医生评估预测是否与临床推理和生物学合理性一致,并识别由混杂因素或机构实践模式驱动的虚假关联。这在血液系统恶性肿瘤中尤其重要,因为治疗路径复杂,且指征混杂很常见(当给予病情更严重患者的治疗似乎与不良结局相关时)。在这种背景下,可解释性不仅作为建立信任的机制,还可作为防止意外偏见的安全保障。
AI 治理在 CAR T 细胞治疗中尤为重要,因为预测可以触发干预措施,从而改变正在预测的结果(例如更早使用托珠单抗或皮质类固醇),产生反馈循环和治疗政策依赖性,当实践演变时,这种依赖性会削弱校准。因此应在临床相关的决策点(LD 前、输注时、发热发作时和第 +1/+3 天)评估模型,并且在部署时,应随着分级系统、支持治疗和产品适应症随时间变化而监测校准漂移。务实的保障措施包括 (i) 预先指定的预期用途和与决策曲线净收益相关的行动阈值,(ii) 跨机构/产品和跨关键人口学/临床亚组的外部验证以评估可迁移性和偏差,以及 (iii) 在嵌入临床决策支持之前,进行前瞻性“静默”部署,并持续审计、重新校准和明确的人机交互工作流程。
实际实施仍然是另一个障碍。即使高度准确的模型,如果在临床实践中使用繁琐、需要输入许多变量,或者未集成到现有界面(如电子病历系统)中,也可能未被充分利用。如果集成到临床工作流程中,预测模型如果显示出可靠的区分度和校准度以及明确的风险或行动阈值,就有可能影响临床管理。例如,一个由输注前变量组成的预测严重 CRS 的模型,可以为重症监护室观察或更早使用托珠单抗或皮质类固醇等临床决策提供信息。类似地,生存模型可以帮助指导咨询、随访或监测频率以及后续治疗的规划。此外,随着 CAR T 细胞疗法随着新构建体、适应症和管理策略的发展,预测模型必须持续更新以考虑数据漂移并随时间保持其准确性。这需要在现实环境中建立强大的模型再训练和再验证机制。
针对上述挑战以增强预测模型适用性的潜在解决方案是多因素的,包括纳入联邦学习模型以创建更大的数据集,同时仍保护患者隐私和可识别数据。一旦稳健建立,就可以克服机构间尝试共享数据所固有的负担,因为单个机构可以开发本地模型,然后共享并与其他模型组合,以创建更广泛适用的集体模型。这种方法对于单中心数据集较小的罕见疾病或毒性尤其有价值,并且它可以提高对数据异质性的稳健性,同时支持 CAR T 细胞治疗中公平的 AI 部署。
除了联邦学习,多任务和迁移学习方法在 CAR T 细胞应用中也未得到充分探索。多任务模型可以联合学习相关结局,如 CRS、ICANS、血液毒性和生存,从而提高较小队列的效率和性能。从更大的肿瘤学数据集中进行迁移学习,然后在 CAR T 细胞特异性人群上进行微调,可能进一步减少样本量的限制。与此同时,纳入新患者数据和不断发展的治疗方案的动态模型更新,为构建能够更好地反映快速变化的 CAR T 细胞格局的自适应系统提供了一条路径。总之,这些方法代表了从静态预测工具转向更具弹性和临床一致性的建模策略的机会。
最后,协调定义毒性的共识指南可以实现跨试验/治疗的可比性和数据收集的标准化。反过来,这也将促进模型的改进以及跨机构和 CAR T 细胞平台后续的泛化能力。
结论
总之,由于患者群体和细胞治疗产品的异质性、该领域快速发展的性质,以及 CAR T 细胞毒性管理的不断进步,CAR T 细胞治疗中的预测建模面临重大挑战。需要持续努力来完善模型并确保在不同临床环境中的适用性。尽管更大的训练队列规模、联邦学习和标准化指南可以提高模型准确性,但未来的模型可能需要针对特定的 CAR 构建体或疾病类型进行定制,以保持预测能力,特别是对于预测 CRS 或 ICANS。此外,在预测其他毒性方面存在显著差距,特别是 IEC-HS 和非 ICANS 神经毒性。随着该领域在 CAR T 细胞治疗背景下不断完善预测模型,我们也可以从现有模型中提取有价值的见解,以更好地理解影响生存和毒性的因素。
参考文献
Blood Cancer Discov . 2026 Aug 11:OF1-OF23. doi: 10.1158/2643-3230.BCD-25-0458.

