ARTICLE · 1130477
AI抗体药物研发全流程
一家AI抗体公司,一年到底在忙什么?
说实话,我观察AI抗体赛道挺长时间了。从2024年一堆公司冒出来,到2026年头部玩家开始交出成绩单,这个行业的变化速度比多数人想象的要快得多。这个赛道的魅力在于,它既有前沿算法的性感,又有湿实验的泥土气,缺一不可。
但有个事儿我一直觉得被严重误读了——很多人以为AI抗体公司就是"训练一个大模型,跑一跑,出几个分子,完事"。好像核心竞争力是谁的GPU多、参数大,谁就是老大。
真的不是这样。
我花了不少时间去了解几家头部公司的实际工作流,跟做抗体的人聊、看他们的项目记录、翻他们的公开报告,发现这玩意儿其实是一条完整的、干湿闭环的项目流水线,从立项到湿实验验证,每一步都在拉锯,每一步都考验生物学深度和工程化能力。今天就把这条线拆开来说说,一家AI抗体公司,一年到底在忙什么。
先说一个最反直觉的事:一家AI抗体公司,在项目启动阶段花最多时间的,其实是判断"这个靶点该不该做"。
没错,不是"怎么做",是"该不该做"。
团队要深入调研靶点的生物学机制、竞争格局、临床未满足需求,确定技术可行性和最终目标——是做到PCC还是PCC+。同时提前规划时间周期、成本预算、算力资源调度方案。这一步本质上是在做减法:砍掉不该做的项目,把有限资源集中在最有希望的方向上。一个项目如果靶点生物学机制没摸清楚、临床需求不够刚、竞争格局已经红海一片,哪怕AI能力再强也没必要硬上。我见过太多团队在方向上偷懒,觉得"反正AI厉害什么都做得出来",结果半年后发现靶点本身就不值得做,白白烧了几个月算力和人力。方向选错了,后面AI再猛也救不回来。真正会做项目的团队,在这一步花的时间往往比后面任何一个环节都多。
判断完"该不该做",接下来才是"该不该用AI"。
不是所有项目都要上AI,这点很多传统Biotech没想明白。2026年了,好像什么都得套个AI,但说实话,不该用AI的项目硬上AI,纯粹浪费时间和钱。AI真正的切入点,是那些传统方法搞不定的场景——抗体设计空间有多大?理论上超过10的11次方,人根本筛不过来。多目标优化怎么做?亲和力、特异性、成药性、免疫原性要同时优化,传统方法一个个来根本扛不住。难靶点怎么搞?GPCR、离子通道这些,传统手段效率极低,有些靶点压根就没有好的免疫原,抗体结合位点藏得严严实实。但如果一个项目用传统杂交瘤或者噬菌体展示就能搞定,硬要套AI流程就是给自己加戏,花了大价钱搞了一套AI pipeline,出来的东西还不如老方法直接筛来得实在。
确认了AI切入点之后,真正的大头活来了:准备测试数据集。
这一步很多人觉得不就是收集数据嘛,有什么难的。太难了。你要收集已知阳性参考抗体和阴性抗体的数据,建立测试集来评估AI算法模型的准确度。数据集质量决定模型上限——垃圾进垃圾出,这道理谁都懂,做起来是另一回事。抗体序列数据不像小分子有ChEMBL这种公开大库可以随便用,抗体的公开数据又散又杂,清洗标注工作量巨大,而且很多数据的质量根本没法保证。你得一条一条核实来源、验证活性数据是否可靠、统一格式,这个过程枯燥但绕不过去。
作者的判断
头部公司的壁垒,往往就在这里。私有序列库、积累的失败案例——负样本比正样本值钱得多,因为"什么路走不通"往往比"什么路走通了"更有信息量。这些东西是拿时间和钱堆出来的家底,别人抄不走。算法模型谁都能搭,数据集你从哪儿弄?
有了数据集,才算进入大家最兴奋的环节:抗体计算设计。
结合AI模型预测加上人工经验判断,筛选候选突变体。不同项目可能分两阶段:先做"大范围探索",初筛几千到数百个候选,这一阶段靠模型的泛化能力把空间铺开;再做"精细化设计",精修到数十甚至数个候选,这一阶段靠的是对每个位点的深入理解和人工经验。AI在这里不是替代人,是扩展人的设计空间——它能在人想不到的区域找到好的候选,但判断这些候选是不是真的靠谱,还得靠有经验的抗体工程师。
Chai-2 核心数据
200倍
命中率提升
<20
每靶点设计数
≤2周
设计到读出
Chai-2的做法很有说服力。这家公司2024年成立,创始团队来自OpenAI和Absci,做zero-shot抗体设计,52个靶点平均命中率约16-20%,相比传统计算方法0.1%提升了200倍。更关键的是,每个靶点只测不到20个设计,从设计到读出不超过2周。200倍命中率提升,每个靶点只测不到20个设计——这说明什么?说明AI的价值不是穷举,而是把人的设计空间从"大海捞针"压缩到"精准制导"。最终拍板的,还是人。
接下来,候选分子被送进实验室。这才是真正见功夫的环节。
湿实验验证——亲和力、特异性、功能性,还有可开发性:稳定性、表达量、聚集倾向,一个都不能少。很多人觉得湿实验就是跑个流程,跟工厂流水线似的,样品进去数据出来。其实完全不是这么回事。湿实验本身不难,难的是"读懂"实验数据。这是整个AI抗体公司最容易被低估的环节。
同一批候选分子,在不同表达系统、不同检测方法、不同批次条件下跑出来的亲和力数据可能差几倍。不了解这些变量,就会被数据牵着鼻子走。批次效应、表达系统差异、检测方法差异,都会影响最终的亲和力数据解读。算法再强,也替代不了有经验的人去判断"这个数据差异是真实信号还是实验噪声"。一个分子表达量低但亲和力好,是该优化表达还是直接放弃?这个判断,靠的是日积月累的实验直觉,是隐性知识,不会写在SOP里,也不会出现在论文里,但恰恰是这种知识决定了一个项目是继续推进还是及时止损。说白了,湿实验解读能力就是一道隐形门槛,跨不过去的公司永远只能停留在"AI算得很准"的阶段,永远走不到真正能用的分子。
每一轮迭代不是简单重复——你要分析上一轮哪些设计被验证了、哪些推翻了原来的假设、模型在哪里预测准了、哪里偏了。这些反馈信号怎么编码进下一轮设计,是整个闭环最核心的技术活。3-5轮迭代,是行业典型节奏。
几个数字可以感受一下:大湾区生物AlfaBodY平台,单轮迭代周期3周,PCC+分子8个月内交付,候选少于300条序列——传统方法得3-5轮迭代才勉强接近这个水平。Absci从AI设计到湿实验验证最快6周,内部两个管线从立项到IND约2年,每管线约1500万美元。三友生物AI-STAL 2.0做到14天候选分子发现全闭环,从文库筛选到核心分子验证一气呵成。明度数智PTM预测准确率94.1%,减少75%纯化实验量。传统抗体发现12-24个月,AI压缩到4-8周。传统药物发现从立项到临床开发4-6年,成本超1亿美元,成功率不到5%。
作者的判断
这些数字背后的核心变量是迭代速度。3周一轮和6周一轮,一年后就是2倍迭代数的差距。算法模型会趋同,大家都在用transformer、diffusion、GNN这些基础架构,你有的别人很快也会有。真正的壁垒在算法之外——私有数据集,尤其是失败样本;湿实验解读团队,那些读数据的隐性知识靠经验堆出来的,不是买几台仪器就能解决;干湿闭环的工程化能力,数据怎么在干湿之间高效流转,怎么减少每轮迭代的信息损失,怎么缩短每轮周期,这才是真功夫。算法模型像"发动机",但"发动机"再好,油箱空了也跑不起来。
最后说说钱的事,毕竟行业最终要回到商业逻辑上来验证。Absci两个管线从立项到IND约2年,每管线约1500万美元,这已经比传统路线省了一大截。英矽智能2026上半年营收1.06亿美元,同比增长287%,毛利率90.3%,BD总额65亿美元,是AI制药平台型公司的标杆。Chai-2 2026年1月与礼来达成合作,年费八位数美元。这些数字说明一件事:资本已经为AI抗体的效率买单了,但买单的不是你的模型有多大,而是你能多快交出靠谱的分子。
所以回到开头那个问题:一家AI抗体公司,一年到底在忙什么?
忙的是不断加速"干湿闭环"这个循环。让每轮迭代更快、更准、更省。
算法是工具,数据是燃料,湿实验是裁判。真正值钱的,是一支能把这三样东西串起来、跑得快、跑得稳的团队。