乐于分享
好东西不私藏

AI 制药刷屏之后,真正的问题回到了项目现场

AI 制药刷屏之后,真正的问题回到了项目现场

SOTALAB · 

Medicine Design Eval & Training Data

——

药化真正难的,是在互相冲突的目标之间取舍

这两天,AI 制药又一次刷屏。

Merck 和 Moderna 宣布,个体化 mRNA 新抗原疗法 intismeran autogene 联合 KEYTRUDA,在高危黑色素瘤辅助治疗 III 期临床试验中,达到了无复发生存期和远处无转移生存期两个关键终点。

图 1|Merck 与 Moderna 的个体化 mRNA 新抗原疗法公布 III 期阳性结果后,AI 制药再次成为行业讨论的焦点

这不是一句“AI 治愈癌症”就能概括的故事。

它更像是几条长线终于在临床结果里交汇:肿瘤测序让医生看见患者个体化的突变,mRNA 平台把这些信息转化成可制造的治疗方案,算法参与新抗原筛选与设计,最后再由大规模临床试验给出验证。这里面没有单点奇迹,更多是多年技术积累走到了一起。

对 AI 制药行业来说,这条新闻真正值得关注的地方在于:AI 正在从“研发辅助工具”,慢慢进入更接近真实决策和临床转化的位置。

但越往真实项目里走,问题越不会只停留在“模型有多强”。

药物研发最终要落到一轮轮具体判断:数据能不能信,结构证据够不够,风险是不是已经影响推进,下一轮实验该先做什么。一个模型能写出漂亮解释是一回事,能不能在这些判断里帮上忙,是另一回事。

这也是 SoTALab 做药化专家数据 Medicine Design Eval & Training Data 的原因。

我们今天想讨论的正是它能不能真正参与药物化学项目。

01 榜单让进步可见,但项目不会按榜单推进

过去几年,AI 制药领域并不缺 benchmark。

化学知识问答、分子性质预测、反应预测、分子生成、工具调用,各类评测让模型能力变得更容易比较。

榜单本身是有价值的。没有这些公共尺度,行业很难判断模型到底进步在哪里,也很难把不同团队的结果放到同一张桌上讨论。

图 2|现有 benchmark 让模型能力更容易被比较,但多数仍停留在单项任务。药化评测训练集想补上的,是跨结构、实验与约束的项目级判断。

问题在于,真实药化项目很少是一个孤立任务。

项目里常见的情况是,多项指标同时摆在面前,而且彼此牵制。活性、选择性、溶解度、渗透性、代谢、安全性、合成可行性、专利空间,没有哪一项可以单独决定项目命运。

药化团队每天做的不是寻找一个“标准答案”,而是在不完整的信息里做取舍。

这一轮该优先提高活性,还是先把风险压下来;一个结构解释看起来合理,但有没有足够实验支撑;一个分子设计很漂亮,但合成路线和专利空间是否允许继续推进。

这些判断,才是项目真正前进或停下来的地方。

所以,当 AI 模型开始进入药物研发,单纯知道它在某个榜单上排名靠前还不够。行业更需要知道的是:它能在哪一类项目问题里稳定帮忙,在哪些地方还需要人类专家兜底。

02 真正难的,是有证据边界的取舍

药物化学家的价值,不只是知道某个官能团、某条反应或某个性质指标。

更关键的是,他们知道证据能支持到哪里,也知道哪些结论现在还不能说太满。

图 3|药化判断不是单一能力题。模型可能擅长结构,也可能卡在 ADMET、合成路线或专利边界上,分维度评分才能看清它适合用在哪一段工作

这类能力很难用一个简单的“答对 / 答错”衡量。

一个答案可能方向对,但证据用错了;也可能结论保守,但恰好指出了关键风险。真实项目里,这两种答案的价值完全不同。

SoTALab 想评测的,正是这种更接近项目现场的能力:模型能不能把分子设计、实验数据、结构证据、ADMET 风险、合成路线和专利约束放在同一个情境里,给出可追踪、可复核的判断。

03 难度分层,是为了看模型适合放在哪个位置

我们设计了 L1-L3 三层难度。

图 4|从 Junior 到 Director,题目难度对应的是不同层级的药化判断:从基础常识,到下一轮分子设计,再到 series 取舍和 go / no-go

这不是为了把题目做难。

相反,它是为了让模型能力有更清楚的使用边界。一个模型能稳定完成 L1,可能已经适合做知识整理和基础分析;如果能在 L2 上给出可靠设计,就可以进入更实质的药化协作;如果在 L3 上也能给出有证据、有边界的判断,才真正接近项目决策支持。

对药企、biotech 和 AI 制药团队来说,这种分层比“榜单第几名”更实用。

04 让模型直接读原始证据,难度会明显上来

真实项目很少只给模型一段整理好的文字。

实验数据可能在表格里,结构信息可能在 PDB 或论文补充材料里,专利边界可能藏在 claim 里,关键风险可能来自某个不起眼的对照实验。

OpenAI 的 LifeSciBench 也有类似观察:当任务需要处理附件证据时,模型通过率会明显低于纯文本任务。原因很简单,整理好的结论已经替模型做了一半工作;真正的研究任务,需要模型自己从材料里抽取信息、对齐口径、形成判断。

图 5|LifeSciBench 的结果提示了一个现实问题:当任务从纯文本回答变成读取附件证据,模型表现会明显承压。真实研发恰恰经常发生在这些“不干净”的材料里

Medicine Design Eval & Training Data 会沿着这个方向设计题目。

每道题不仅有题干和参考答案,还会记录能力维度、研发阶段、难度、附件证据、评分锚点、来源许可和泄漏风险。项目决策题允许多条合理答案路径,但每条路径都要能追溯到具体证据。

评测的重点,不只是模型最后选了什么,而是它为什么这么选。

05 一个样例题,为什么要拆成多个评分点

有一道样例题,来自一个片段发现得到的变构抑制剂系列。

题目要求模型解释两步分子改造:A 到 B,把柔性侧链约束起来;B 到 C,再引入一个邻位甲基。模型需要结合实验数据和结构证据,说明每一步改造带来的变化,也要指出哪些解释目前还不能确定。

这道题看起来像一道普通 SAR 题,但真正评分时不会只看一句结论。

图 6|一道药化题不只是看结论对不对,更要看模型有没有守住证据边界。能说清“支持什么”和“还不能确定什么”,才接近真实项目里的判断

完整答案不只是“讲得通”,还要讲得有边界。

这正是药化项目里常见的难点。很多错误不是因为模型完全不知道,而是因为它把证据用过了头。

06 SoTALab 正在推进开放共建

Medicine Design Eval & Training Data 的目标量级约为 200 题,覆盖 8 个能力维度和 L1-L3 难度梯度。

题目以小分子为主,同时覆盖抗体 / ADC payload / linker、大环 / 多肽等方向;研发阶段则从 hit triage、lead optimization,延伸到 PCC nomination / FTO。

我们希望它最终不是一份静态题库,而是一套可持续更新的药化评测基础设施。

因此,Medicine Design Eval & Training Data 会重视几件事:

图 6|每道题都需要记录题干、附件、评分锚点、rubric、来源许可和泄漏风险。这样评测结果才可追溯,训练数据也更适合后续定向补齐能力短板

更重要的是,我们会引入人类基线。由药化专家在同一套题上作答,并经过盲评复核,作为判断模型是否接近人类项目水平的参照。

目前我们已经建立 100 位药化出题专家组成的核心网络,背后连接 20 万知乎高质量答主可触达作者池与 2000+ 在库 PhD。专家方向覆盖小分子、多肽、AIDD / CADD、SBDD、ADMET / DMPK、合成路线、专利分析等。

覆盖清华化学系博士后、北大前沿交叉博士、德国开姆尼茨工业大学博士、清华药学博士等背景,方向包括小分子 / 多肽药物设计、AIDD / CADD、化学生物学、药理药效与药毒检测等。

图 7|药化题库真正难的是稳定供给。SoTALab 先按项目需求定义题目分布,再匹配对应方向的药化专家出题和复核,避免题库只是在数量上变大,却没有覆盖真实能力缺口

07 热点会过去,评测会留下来

AI 制药的热点还会继续出现,这对行业不是坏事。

热点让更多人看到技术可能性,也让资本、药企、biotech 和模型团队更愿意把问题往前推。但真正进入项目以后,大家最终还是要回到一件事:模型能不能在真实研发流程里稳定创造价值。

Medicine Design Eval & Training Data 想做的,就是给这个问题提供一把更接近药化项目现场的尺子。

不是只看模型会不会答题,而是看它能不能读证据、识别风险、提出设计、承认证据边界,并帮助团队做出下一步判断。

如果你正在训练、选型或评估 AI 药化模型,或者你也希望推动更开放、更可复现的药化评测,欢迎参与 Medicine Design Eval & Training Data 共建。

原文链接:https://sotalab.ai/zh/whitepapers/medchem

关于 SoTALab

SoTALab 将全球权威专家的专业知识转化为数据和评估结果,用于训练最先进的模型。我们是一支专注的团队,致力于招募工程师和研究人员,希望我们的工作能够塑造前沿人工智能的学习方式。 

若您想要加入我们或对我们感兴趣,请联系contact@sotalab.ai

© THE END

转载请联系本公众号获得授权