乐于分享
好东西不私藏

AI助力CHO细胞强化工艺:从开发规模走向2000 L生产规模

AI助力CHO细胞强化工艺:从开发规模走向2000 L生产规模

导  读

大家好,今天推送的文章是2026年8月发表Biotechnology and Bioengineering的“Hybrid Dynamic Modelling With Gaussian ProcessRegression for Intensified Fed‐Batch CHO Cell Culture Processes”,通讯作者为英国伦敦大学的Kallum Doyle老师。

随着生物制药行业向高效化、数字化及智能化方向发展,强化型补料分批培养(Fed-batch)逐渐成为提高单克隆抗体生产效率的重要技术策略。然而,高细胞密度培养条件下细胞生长、代谢及产物形成过程具有显著的动态性和非线性特征,传统基于预设动力学关系的机理模型在复杂过程描述及多工艺参数表征方面存在一定局限。为提高强化型CHO细胞培养过程的动态预测能力,该研究构建了一种基于高斯过程回归(GPR)的混合动态模型,并对其在不同工艺、不同数据条件及不同培养规模下的预测性能进行了系统评价。

该研究以两种强化型补料分批 CHO 细胞培养工艺 Process A 和 Process B 为对象,利用开发阶段和规模化生产阶段获得的过程数据开展模型构建与评价。在此基础上,以活细胞浓度、死细胞浓度、葡萄糖浓度、乳酸浓度、单克隆抗体产量、温度及pH等过程变量作为输入,利用GPR建立过程状态与细胞比速率之间的非线性映射关系,从而实现细胞生长、底物消耗、代谢物生成及抗体生产过程的动态预测。同时,以传统Monod型机理模型作为对照,并进一步考察开发过程中数据逐步增加以及开发尺度数据向生产尺度迁移对模型性能的影响。

结果和讨论

GPR混合模型的Fed-batch过程预测效果

为评价AI在Fed-batch过程建模中的应用效果,作者首先将GPR混合模型与传统Monod型机理模型进行比较。

结果表明,两种模型均能够在一定程度上描述Process A生产规模培养过程中细胞生长、底物消耗、代谢物生成及抗体积累的动态变化,但不同变量的预测性能存在明显差异。总体来看,GPR混合模型在VCC、DCC、乳酸和mAb等变量上的预测效果较好,表现出较强的复杂动态过程表征能力。训练集和验证集中,GPR混合模型的总RMSE分别为5.73×10³和4.09×10³,低于Monod模型的6.40×10³和6.10×10³,说明GPR能够利用过程数据学习传统固定动力学关系难以充分描述的非线性变化。

进一步比较不同过程变量可以发现,GPR混合模型的优势主要体现在DCC、乳酸和mAb等变量的预测上,但葡萄糖预测表现相对较弱。在测试集中,GPR混合模型的总RMSE为5.89×10³,而Monod模型为5.72×10³,两者整体预测误差较为接近。其中,GPR模型对VCC的测试误差高于Monod模型,但在DCC、乳酸和mAb浓度预测方面具有较明显优势;相反,在葡萄糖浓度预测中,Monod模型的RMSE低于GPR模型。该结果说明,GPR混合模型虽然能够提高对部分复杂代谢行为的描述能力,但其优势并非对所有变量均保持一致,而是受到不同物质动力学特征及训练数据质量的影响

从动态预测趋势来看,GPR混合模型倾向于高估培养过程中的葡萄糖浓度,而Monod模型则表现出一定程度的低估。造成这一差异的重要原因与Fed-batch过程中的葡萄糖补加方式有关。Process A除连续补料外,在培养初期还采用每日葡萄糖脉冲补加。脉冲加入后,葡萄糖浓度迅速升高,细胞比葡萄糖消耗速率也会发生快速变化;然而,模型训练所依据的细胞比速率主要根据相邻日采样点进行估算,因此反映的是采样间隔内的平均消耗速率,难以捕捉脉冲补料后的短时瞬态变化。由此导致GPR模型低估实际葡萄糖消耗速率,并进一步造成预测葡萄糖浓度偏高。

相比之下,传统Monod模型的预测局限主要来源于预设的动力学结构。该模型将细胞生长与葡萄糖消耗相互耦合,并采用固定产率系数描述乳酸生成和mAb生产过程。在强化型Fed-batch培养中,主要细胞生长阶段已较大程度发生于N−1灌流阶段,进入生产反应器后净细胞生长相对有限,使最大比生长速率等参数的准确辨识受到限制。同时,固定产率系数容易使乳酸和mAb预测呈现相对线性的变化趋势,难以充分反映实际培养过程中动态变化的代谢状态。相比之下,GPR无需预先指定具体动力学函数形式,而是根据实验数据建立过程状态与细胞比速率之间的非线性关系,因此在描述乳酸代谢和抗体形成等复杂动态过程方面具有更高的灵活性。

总体而言,该比较结果说明,GPR混合模型在Fed-batch过程中的主要优势并非简单表现为整体预测误差始终低于传统机理模型,而在于其能够降低对固定动力学结构的依赖,并提高对复杂、非线性细胞代谢过程的动态表征能力。同时,葡萄糖预测结果也表明,AI模型的性能受到过程数据时间分辨率和信息完整性的显著影响。当关键瞬态过程未被实验数据充分捕获时,即使采用更灵活的机器学习方法,也难以获得准确的动力学预测。因此,GPR混合模型的应用效果既取决于算法本身,也与Fed-batch过程的数据采集策略密切相关

开发规模数据量及实验

设计对模型性能的影响

在验证GPR混合模型基本预测能力后,进一步研究了随着工艺开发过程中实验数据逐步增加,模型性能的变化规律。为模拟实际工艺开发中数据逐渐积累的过程,作者根据Process A已有实验设计将开发规模数据依次划分为Set A、Set B、Set C和Set D。其中,Set A包含早期单一实验设计,随后各数据集逐步纳入更多开发实验,Set D则在Set C基础上进一步加入与生产条件较为接近的satellite batches。通过比较不同数据集训练所得模型的测试误差,旨在判断增加实验数据是否能够持续改善GPR模型的预测能力

结果表明,模型性能并未随训练数据量增加而呈现持续改善趋势。以Set A的测试RMSE作为基准进行归一化后,除DCC外,多数变量在Set A中反而表现出较低的相对预测误差,而加入更多实验数据后的Set B整体误差明显增加;当数据进一步扩展至Set C和Set D时,模型性能有所变化,但仍未形成“数据量越大、预测误差越低”的单调关系。 这一结果说明,在Fed-batch数据驱动建模中,训练样本数量本身并不能直接决定模型性能,新增数据所包含的过程信息及其复杂程度同样具有重要影响

作者进一步从实验设计角度解释了这一现象。Set A主要来源于较为简单的单因素实验设计,其覆盖的工艺参数空间相对有限,变量之间的交互作用较少,因此GPR需要学习的输入—输出关系也相对简单。相比之下,Set B、Set C和Set D逐渐纳入更高阶的实验设计,其中不仅包含更宽范围的工艺参数变化,还涉及变量之间的交互作用和非线性效应。随着设计空间复杂程度提高,模型需要同时学习更多潜在动力学关系,因此预测任务本身也更加困难。

Set C与Set D之间的比较进一步说明了“数据数量”与“数据有效信息量”之间的差异。Set D在Set C基础上加入了多个satellite batches,这些批次主要用于模拟生产规模的标准运行条件,因此各工艺参数通常集中在正常操作区域附近,并没有进行大范围或系统性的变化。结果显示,加入这些额外批次后模型性能并未获得一致改善,Set C和Set D的整体RMSE较为接近,其中mAb预测性能甚至出现一定下降。作者认为,这可能与satellite batches提供的新参数信息有限,同时增加了批间变异和实验噪声有关,从而降低了与抗体生产相关信号的信噪比。

进一步的模型预测结果也表明,数据质量和过程信息完整性会直接影响GPR对不同物质动力学的识别。例如,葡萄糖仍表现出一定程度的浓度高估,这与脉冲补料后的瞬态消耗行为无法被日采样数据充分捕获有关;乳酸预测虽然整体与实验结果保持一定一致性,但离散程度较大。Process A中使用乳酸溶液进行pH调节,而不同批次实际加入的乳酸量并未包含在模型开发数据中,因此实验观察到的乳酸变化同时包含细胞自身代谢和外源添加两种贡献。由于缺少这一关键输入信息,GPR难以准确识别真实的细胞比乳酸生成速率,从而增加乳酸预测结果的波动。

因此,该部分结果表明,对于AI辅助Fed-batch过程建模,“更多数据”并不等同于“更好的模型”。模型性能不仅取决于训练样本数量,还取决于实验设计能否系统覆盖关键工艺参数、数据是否包含足够的变量交互和非线性信息,以及影响培养过程的重要操作变量是否被完整记录。相比单纯增加重复实验批次,通过合理的实验设计扩大有效参数空间并提高数据的信息含量,对于提升GPR混合模型的可靠性和泛化能力更为重要。这也说明,在Fed-batch过程的AI应用中,应将机器学习模型开发与实验设计和数据采集策略协同考虑,而不能将模型性能提升简单归因于数据规模的增加。

GPR混合模型的跨规模预测性能

在开发尺度模型评价的基础上,作者进一步考察了GPR混合模型由开发规模向生产规模迁移的能力。由于AI模型学习到的动力学关系主要来源于训练数据,而反应器规模变化可能导致细胞所处培养环境发生改变,因此,仅利用开发规模数据建立的模型能否直接用于生产规模预测,是评价该模型实际应用价值的重要问题。为此,作者以生产规模批次作为预测目标,并通过改变训练数据的规模组成,比较不同数据来源对模型跨规模预测性能的影响。

针对Process A,作者构建了三类GPR混合模型。其中,Model A仅采用开发规模数据进行训练,用于评价模型直接由开发规模向生产规模外推的能力;Model B在开发规模数据基础上加入部分生产规模数据,用于考察少量目标尺度数据能否改善模型性能;Model C则仅采用生产规模数据进行训练,作为目标尺度建模的比较基准。通过三类模型的逐步比较,可以进一步判断模型预测误差究竟主要来源于训练数据量不足,还是开发规模与生产规模之间本身存在系统性的动力学差异。

结果显示,仅采用开发规模数据建立的Model A跨尺度预测能力相对有限。在生产规模测试批次中,Model A对多个过程变量均表现出较大的预测偏差,总RMSE约为1.74×1041.74\times10^41.74×104。当在开发规模数据基础上加入部分生产规模数据后,Model B的预测性能明显提高,总RMSE下降至约6.38×1036.38\times10^36.38×103。进一步地,仅采用生产规模数据训练的Model C总体表现最佳,总RMSE进一步降低至约5.89×1035.89\times10^35.89×103。 这一变化表明,即使仅加入部分目标生产规模数据,也能够明显改善模型对生产过程的描述能力,说明生产规模数据中包含了开发规模数据无法完全提供的动力学信息

进一步比较Model B与Model C可以发现,将开发规模数据与生产规模数据简单合并,并不一定能够获得最佳预测效果。尽管Model B已经包含更多训练数据,但其总体性能仍略低于仅使用生产规模数据建立的Model C。这意味着影响模型性能的关键并非单纯的数据数量,而是训练数据与目标预测过程之间的一致性。换言之,如果不同培养规模之间存在系统性差异,大量开发规模数据可能无法完全弥补目标尺度信息不足的问题。因此,对于面向生产过程的AI模型而言,与目标培养规模直接相关的数据具有更高的建模价值。

为了判断这一现象是否仅存在于Process A,作者进一步利用Process B进行了验证。结果总体呈现相似趋势:仅使用生产规模数据训练的Model C在多数过程变量上表现出较好的预测性能,特别是在VCC、乳酸和mAb等变量上与实验结果具有较好的一致性。然而,Model A与Model B之间的改善程度并非在所有变量上完全一致,部分变量加入生产规模数据后的预测提升相对有限。 这说明生产规模数据总体有助于提高模型性能,但其作用程度还受到具体工艺和预测变量的影响,表现出一定的工艺依赖性和变量依赖性

开发规模模型难以直接迁移至生产规模,进一步说明两个培养尺度之间可能存在当前GPR输入变量无法充分表征的系统性差异。随着反应器体积增加,混合时间、传质特性以及局部底物和代谢物浓度梯度等均可能发生变化,使细胞实际经历的微环境与开发规模存在差异。然而,当前GPR主要以VCC、DCC、葡萄糖、乳酸、mAb、温度和pH等宏观过程变量作为输入,并未直接包含混合、传质或局部环境等尺度相关信息。因此,即使不同规模下平均pH、温度和底物浓度相近,模型也无法仅依据现有输入变量识别细胞实际经历的尺度效应。

总体而言,跨尺度预测结果表明,GPR混合模型并不能仅依靠开发规模数据自然实现向生产规模的直接迁移,而引入目标生产规模数据能够显著改善模型的预测性能。

小结

该研究将高斯过程回归(GPR)与物料衡算相结合,构建了用于强化型CHO细胞Fed-batch培养的混合动态模型,实现了对细胞生长、底物消耗、代谢物生成及mAb生产过程的动态预测。与传统Monod型模型相比,GPR混合模型在VCC、DCC、乳酸和mAb等变量的预测中表现出较好的灵活性,但葡萄糖预测结果表明,其性能仍受到采样频率和数据时间分辨率的限制。进一步研究发现,增加实验数据并不能保证模型性能持续提高,实验设计、参数空间覆盖程度以及关键过程信息的完整性对模型学习效果更为重要。此外,仅采用开发规模数据建立的模型难以准确预测生产规模过程,而引入生产规模数据后预测性能明显改善,说明不同培养规模之间可能存在尚未被模型充分表征的混合、传质及局部微环境等尺度效应。因此,AI在Fed-batch过程中的应用不仅依赖算法本身,还需要与高质量数据采集、合理实验设计及工艺机理相结合,并通过引入尺度相关特征和迁移学习等方法,进一步提高模型在过程动态预测和规模放大中的可靠性与泛化能力。

参考文献:

[1] Doyle, K., O. Yang, T. Colarusso, G. Bano, B. Glennon, and I. J. d. Val. 2026. “ Hybrid Dynamic Modelling With Gaussian Process Regression for Intensified Fed-Batch CHO Cell Culture Processes.” Biotechnology and Bioengineering 0: 1–14. 

https://doi.org/10.1002/bit.70339.