ARTICLE · 1138497
AI如何进入药品研发监管体系?FDA、EMA、ICH与中国药监局的最新文件,正在建立一套新的证据规则
过去,医药行业讨论人工智能,更多关注AI能否发现靶点、设计新分子、预测药物活性,或者缩短药物研发周期。
但从2025年开始,一个更加值得关注的变化出现了:FDA、EMA和ICH开始系统讨论,如何评价AI生成的研发证据,以及这些证据在药品监管决策中究竟能够承担多大作用。
这意味着AI在药物研发中的角色,正在从辅助研发工具,进一步延伸到具有监管意义的证据生成方法。
这一转变并不意味着AI可以代替动物试验或临床试验。监管机构真正关注的是,当AI开始参与药品安全性、有效性和质量判断时,如何证明模型输出可靠,如何发现预测错误,以及如何明确最终的判断责任。
一、FDA:AI能否用于监管决策,关键取决于使用场景
2025年1月,FDA发布了《Considerations for the Use of Artificial Intelligence to Support Regulatory Decision-Making for Drug and Biological Products》指南草案。
这份文件最重要的贡献,不是鼓励药企使用AI,而是提出了一个风险驱动的AI模型可信度评价框架。
FDA首先引入了一个核心概念:Context of Use(COU),即模型的具体使用场景。
同样一个AI模型,用于检索非临床试验资料,与用于预测人体安全剂量,所承担的监管风险完全不同。
前者主要承担信息整理任务,后者可能直接影响临床受试者安全。因此,FDA不主张脱离具体用途,仅凭模型整体准确率就认定其足够可靠。
指南提出了七步可信度评价流程,包括明确科学问题、确定COU、评价模型风险、制定可信度评价计划、执行评价、记录结果和偏差,以及最终判断模型是否适合预定用途。
其中最值得药企关注的是模型风险的定义。
FDA将模型风险建立在两个因素之上:
模型影响程度(Model Influence),即AI输出在最终决策中占据多大权重;以及错误决策的后果(Decision Consequence),即如果判断错误,可能带来多么严重的不良结果。
FDA在草案中举过一个临床研究的例子:使用AI判断哪些受试者给药后不需要住院监测。
如果AI是决定监测方式的唯一依据,那么模型影响程度较高。若将本应住院观察的高风险受试者错误归类为低风险,又可能造成严重安全后果,因此该使用场景被判定为高模型风险。
相反,如果AI只是辅助识别药品生产过程中西林瓶装量异常,而每批产品仍有独立的放行检测,虽然错误判断可能造成严重质量问题,但由于还有其他证据控制风险,模型影响程度可以降低。
这一监管逻辑具有很强的现实意义。
监管机构真正评价的不是AI模型本身有多先进,而是它在具体研发决策中承担什么职责,以及发生错误时有没有独立证据和风险控制措施。
需要明确,FDA这份文件截至本文写作时仍属于指南草案,而且不直接覆盖单纯的药物发现,以及不影响安全性、有效性、质量或研究结果可靠性的内部行政效率应用。
因此,不能据此认为所有基于GPT的研发系统都必须提交这一套评价资料,也不能认为符合该草案就自动获得监管认可。
二、FDA与EMA:从模型可信度进一步走向AI全生命周期质量管理
如果说2025年FDA的指南草案重点解决的是AI输出是否可信,那么2026年1月FDA与EMA联合发布的《Guiding Principles of Good AI Practice in Drug Development》,则开始系统讨论AI应当怎样被开发、验证、使用和维护。
这份文件提出10项原则:
这10项原则并不等于已经颁布了一套独立的药用AI强制认证制度,但它们提供了一个重要方向:AI系统的质量不能只在上线前通过一次测试来证明。
例如,一家药企建立了AI辅助非临床毒理评价系统。系统利用公开FDA审评报告训练或构建知识库,并根据靶点机制、动物种属、暴露数据和组织病理变化,提供毒性风险分析。
在投入使用前,企业可能使用历史案例测试系统性能。
但几个月以后,随着数据库扩大、文献更新或者模型版本发生变化,原来的测试结论未必仍然适用。
因此需要明确数据版本、模型版本、评价标准、性能变化监测和重新验证的触发条件。
同时,还需要回答一个容易被忽视的问题:系统究竟是在提取原始数据,还是已经开始依据数据作出新的科学判断?
前者更多涉及信息准确性与完整性,后者则进一步涉及专业推理是否成立、证据是否充分,以及判断是否超出已有资料支持的范围。
AI系统一旦开始影响研发决策,质量管理的对象就不再只是软件,而是软件、数据、专业判断和使用人员共同构成的完整系统。
三、EMA的AIM-NASH案例:AI生成的证据已经开始获得具体监管认可
2024年9月,EMA正式发布《Reflection paper on the use of Artificial Intelligence (AI) in the medicinal product lifecycle》,讨论人工智能在药品全生命周期中的应用。
与FDA强调具体监管决策中的模型可信度相互补充,EMA这份文件将视角进一步扩展到早期药物发现、非临床研究、临床研究、生产制造和上市后活动。
不过,文件提供一般性原则,并不意味着其中提及的每一种AI用途都已得到监管认可。
真正能够说明AI如何进入具体药物研发证据体系的,是AIM-NASH案例。
2025年3月,EMA对AI辅助肝脏病理评价方法AIM-NASH作出了资格认定。2025年12月,FDA也宣布认定该工具用于MASH临床试验中的相关病理评价。
MASH是一种与代谢功能障碍相关的脂肪性肝炎。评价新药疗效时,需要观察肝组织中的脂肪变性、炎症和纤维化等病理变化。
传统方法依赖病理专家对肝活检切片进行评分,但不同专家之间的判断可能存在差异。这种差异会增加临床试验终点评价的不确定性。
AIM-NASH引入AI辅助病理分析,以提高评价的重复性和一致性。
根据EMA公布的信息,该模型开发涉及59名病理专家对5000余份肝活检样本进行的超过10万项标注,数据来源覆盖9项大型临床试验。
这里尤其值得关注三项条件。
首先,模型的评价建立在大规模真实病理资料和专家标注基础上,而不是仅仅提供理论算法。
其次,最终病理评价仍由人类病理专家核验。FDA明确说明,病理专家需要审查整张切片及AI输出,并对最终判断负责。
第三,EMA认定的工具采用锁定模型。若未来发生重大模型修改,可能需要重新进行资格认定。
因此,AIM-NASH案例并不是监管机构接受了一个可以任意更新、自动产生临床结论的通用AI系统。
恰恰相反,它说明了AI进入监管证据体系所需要的具体条件:明确的用途、适用的数据、经过验证的性能、受控的模型版本,以及清晰的人机责任分工。
另外,工具获得资格认定,也不意味着采用该工具的药品自动满足临床疗效要求。
监管机构认可的是一种限定用途下的证据生成方法,而不是对AI技术整体能力作出无限制背书。
这一区别对未来AI辅助药品研发平台具有直接参考价值。
四、ICH M15:AI/ML开始进入国际协调的模型证据评价框架
2026年2月,ICH宣布M15《General Principles for Model-Informed Drug Development》完成Step 4协调。FDA随后于2026年6月发布相应最终指南。
ICH M15并非一份专门针对生成式AI的指南,其主要对象是Model-Informed Drug Development(MIDD),即模型引导的药物研发。
传统MIDD包括群体药代动力学、PBPK、暴露-效应分析、定量系统药理学和疾病进展模型等。
值得注意的是,M15明确将人工智能和机器学习列入可用于MIDD的方法之中。
但这一表述不意味着任何AI预测都能自动成为监管可接受的证据。
M15建立的基本逻辑是,模型研发首先应当服务于明确的科学问题,再根据模型使用场景、模型影响程度及错误决策后果评价风险,并确定模型验证及证据评价要求。
此外,M15还对模型分析计划、模型评价、模型分析报告和监管资料提交提出了协调性建议。
这实际上给AI辅助药物研发提供了一个十分重要的启发。
例如,在非临床研究中,AI可能预测某种新药的系统暴露水平、靶点介导毒性或者不同研究结果对人体风险的提示程度。
但当这些预测被用于支持临床起始剂量、风险监测策略或研究豁免论证时,药企就不能只提交预测值及一段合理性解释。
还需要交代模型建立依据、输入数据质量、验证方式、预测不确定性,以及这些结果相对于其他证据的权重。
2026年3月,FDA还发布了新方法学(NAMs)用于药物研发的一般考虑因素指南草案,讨论新方法的验证和研究结果在药物研发中的适用性。
该草案不局限于AI,也没有普遍取消动物试验要求,但进一步表明监管机构正在探索如何评价不同于传统动物试验的证据来源。
对于希望利用AI减少某些动物研究、优化试验设计的企业而言,这两类文件需要结合理解。
未来模型预测能够承担多少监管证据权重,取决于模型是否针对具体科学问题获得充分验证,而不取决于它是否采用了最新的算法。
五、中国、英国和日本:监管智能化与AI研发证据评价正在同步推进
2026年,中国国家药监局发布《关于“人工智能+药品监管”的实施意见》。
这份文件提出,到2030年初步构建药品监管与人工智能融合创新体系,推进高质量数据集、垂直大模型和智能体建设,并推动AI在审评审批、监督检查、检验监测等场景中的应用。
其中,人机协同智能审评审批是一个重要方向。
文件明确提出推进申报资料电子提交的标准化、结构化,建立审评审批知识库,并通过大模型和智能体支持资料审查、知识检索、问题识别和报告生成等工作。
与此同时,文件强调建立人工复核、全程留痕机制。
在医药产业方面,还提出鼓励企业推动研制、生产、检验和上市后监测的数智化,并研究制定人工智能在医药产业规范应用的指导原则。
这里必须区分两个概念。
一是监管机构使用AI辅助开展审评和监督管理;二是药企使用AI生成支持IND、NDA或BLA的研发证据。
两者存在联系,但并不是同一件事。
当前中国文件明确推进的是监管智能化与产业数智化协同发展,并提出后续规范研究方向。不能直接推导出我国已经建立了一套与FDA 2025年AI模型可信度指南草案完全对应的申报审查制度。
在英国,MHRA于2026年6月宣布启动面向药物研发的AI监管沙盒,探索AI如何预测药物安全性、药代动力学及其他研发风险。
这一机制的价值,在于让开发者与监管机构共同研究怎样验证模型,而不是等模型投入实际使用后才讨论证据是否充分。
日本PMDA则在2025年发布内部AI应用行动计划,并于2026年启动面向医疗产品全生命周期AI使用原则的研究项目,讨论透明度、责任分配、数据治理等问题。
这些进展说明,不同监管机构目前所处的阶段并不完全相同。
FDA已提出较为系统的模型可信度评价草案;EMA不仅发布生命周期反思文件,还完成了具体AI开发工具的资格认定;ICH将AI/ML纳入国际协调的MIDD框架;中国、日本和英国则分别从监管数智化、AI治理和试点验证等方向推进工作。
全球正在形成共同的监管问题意识,但尚不能认为已经出现了一套覆盖所有AI药物研发用途的统一强制规则。
六、药企真正需要建设的,是AI辅助研发的证据与决策体系
从这些文件出发,药企构建AI研发平台时,可以把不同任务划分为三个层次。
第一层是信息处理,例如法规检索、公开审评报告提取、试验设计比较,以及研究资料的结构化整理。
这类任务首先需要解决来源准确性、版本管理、信息遗漏和引用追溯问题。
第二层是辅助科学判断,例如AI识别潜在靶器官毒性、分析暴露与毒性关系、比较不同动物种属的相关性,以及提出研究设计建议。
这类任务需要进一步引入专业评价规则、证据权重和人工复核机制。系统不仅要给出结论,还应当说明使用了哪些数据、适用了哪些判断规则,以及哪些问题仍需要进一步研究。
第三层是直接支持重大研发决策,例如通过AI预测决定临床起始剂量、减少关键毒理研究,或者使模型结果成为影响临床试验终点评价的重要证据。
这类任务通常具有更高的模型影响程度或错误决策后果。其验证要求应当与风险相适应,可能需要独立验证、充分的不确定性评价,以及针对具体用途开展监管沟通。
因此,一个面向医药研发的AI系统,不应当仅仅设计为输入问题、生成答案的聊天工具。
更合理的结构是建立一条连续的证据链:
原始资料与数据 → 结构化提取 → 专业评价规则 → AI辅助分析 → 证据交叉验证 → 专家复核 → 形成可追溯的研发决策记录。
例如,评价一款单克隆抗体的毒理种属相关性,系统不应仅依据靶点序列同源性直接推荐猴或啮齿类动物。
它应当综合评价跨种属结合、功能活性、体内药效、暴露特征及现有风险证据,并明确哪些结论已被实验支持,哪些只是需要验证的假设。
只有这样,AI输出才能真正成为研发团队可以检查、讨论和修正的工作成果。
这里还有一条监管边界:即使系统的所有结论都附有文献来源,也不代表它已经完成科学验证。可追溯解决的是证据从哪里来;可信度评价解决的是这些证据和模型推理能否支持具体决策。
二者缺一不可。
回顾这些文件,全球监管机构并没有简单地把AI视为一种新的研发效率工具,而是逐步将其放进已有的药物开发与证据评价体系。
未来,AI能否参与关键监管决策,不仅取决于算法性能,也取决于模型是否适合预定用途、数据和证据能否被复核、相关风险是否得到控制,以及谁对最终结论负责。
对于药企而言,真正值得投入的或许不是一个能够回答所有问题的通用AI,而是一个能够围绕具体研发场景,稳定生成可验证、可追溯、可复核证据与判断的专业系统。
这也可能是AI从研发辅助工具走向监管可信工具必须完成的一次转变。