ARTICLE · 1030533
AI蛋白质设计的四大引擎,和一个还没填上的鸿沟
AI + 蛋白质设计
AI蛋白质设计的四大引擎,和一个还没填上的鸿沟
从"预测结构"到"按需创作",AI到底走到了哪一步?
我前两天看到一个说法,愣了一下。
诺贝尔奖得主莱维特——对,就是那个因为蛋白质结构预测拿诺奖的老头——说了一句话:"AI蛋白质设计远超我的预期。"
他解释了一句:过去50年,他做的事是预测蛋白质长什么样。现在AI不仅能预测,还能设计全新的蛋白质,全新的药物分子。
你品品这个转变的分量。
从"看看蛋白质长什么样",到"告诉我你要什么功能,我给你设计一个全新的蛋白质出来"——这不是进步,这是换了一个物种。就好比你从"鉴赏画"变成了"画画的人"。
今天这篇文章,我想聊聊AI蛋白质设计这件事,到底走到了哪一步。不吹不黑,有干货,也有卡点。
AlphaFold做的是"看懂"——给它一条氨基酸序列,它告诉你蛋白质折叠成什么形状。这一步在2024年基本算走通了。但"看懂"和"创作"之间,隔着一道巨大的鸿沟。这道沟,是过去两年被填上的。
从"看懂"到"创作",到底发生了什么?
我先说一个直觉性的判断:2024年之前,整个AI蛋白质领域的主旋律是预测。AlphaFold、RoseTTAFold,本质上都是在回答一个问题——"这条序列会折叠成什么结构?"
这当然很重要。2024年诺贝尔化学奖颁给Baker和Hassabis,核心逻辑就是:你终于可以用AI把蛋白质结构测准了。
但2024年之后,风向变了。
Baker实验室搞出了RFdiffusion,后来又迭代到RFdiffusion2、RFdiffusion3。核心能力是什么?是你跟它说"我需要一个能结合XX靶点的蛋白质",它从噪声出发,一步一步给你生成一个全新的蛋白质主链结构。不是修改已有的,是从零创造。
说人话就是:以前AI是翻译官,帮你看懂蛋白质的"长相";现在AI是设计师,你说需求,它出图纸。
这个转变,说实话,比我预想的快了两三年。
David Baker在华盛顿大学拿到了一个叫做"AI BioDesign"的大项目,Allen Institute、华盛顿大学、Fred Hutch三家联合,五年9460万美元资助。项目的目标说得很直白——"先提出需要的功能,再设计并制造相应的生物分子。"
注意这个语序:先有功能需求,后有生物分子。这跟传统药物研发的逻辑是反的。传统是先找一个已有的靶点或分子,再看它能干什么。现在是反过来:我需要什么,就造什么。
四大引擎:AI蛋白质设计的技术底座
拆开来看,现在AI蛋白质设计能跑起来,靠的是四个东西。我管它叫"四大引擎"。
引擎一:深度神经网络——让AI"看见"三维空间
蛋白质是三维的东西,你不能用一维的方式去理解它。深度神经网络,尤其是那些基于SE(3)等变性的架构,解决的就是这个问题——让AI理解空间中的旋转、平移,保证生成的结构在物理上说得通。
说白了,就是给AI装了个"空间感"。不然它生成出来的蛋白质,可能在数学上很漂亮,但在现实世界里根本站不住——原子会撞在一起,键角完全不对。
引擎二:蛋白质语言模型——读懂"生命的语言"
20种氨基酸排列组合出来的序列,某种意义上就是一种"语言"。蛋白质语言模型——类似ESM、ProGPT这类——做的事情,跟GPT理解自然语言是同一套逻辑:从海量序列数据里学到规律,知道哪些氨基酸放在一起是"通顺的",哪些是"瞎扯的"。
这东西厉害在哪?即使没有明确的结构信息,光凭序列,它也能告诉你哪些设计"大概能行"。相当于一个见多识广的老中医,没做检查,凭经验也能给你开个方子。
引擎三:扩散生成模型——核心中的核心
这是我认为整个AI蛋白质设计浪潮里最重要的一个技术突破。
RFdiffusion的思路是这样的:从一个完全随机的噪声结构出发,通过逐步"去噪",最终收敛到一个合理的蛋白质主链结构。你在中间可以加各种约束条件——比如"我要这个蛋白质结合这个靶点",或者"我要这个形状"。模型会在满足约束的前提下,生成全新的结构。
几个关键节点:
• RFdiffusion(2023):首次实现从噪声生成全新蛋白质主链
• RFdiffusion2(2024):引入Flow Matching技术,41个测试案例生成成功率100%
RFdiffusion3(2025.12):扩展到蛋白质-DNA-小分子相互作用
41个案例100%成功率——这个数字让我愣了好几秒。当然,这是计算层面的"生成成功",不等于实验成功。后面会说这个事。
引擎四:知识图谱与多尺度模拟——补上"物理感"
前三个引擎都是数据驱动的。问题在于,蛋白质不是纯数学对象,它是物理实体,要在真实的生物环境里干活。
知识图谱和多尺度模拟做的事情,就是把已知的生物学知识——蛋白质之间的相互作用、动力学行为、热力学稳定性——喂给模型,让它生成的东西不只是"看起来像",还要"物理上站得住"。
这个引擎现在是最弱的一个。说实话,纯数据驱动模型在"物理感"上还是差口气。但如果没有它,你设计出来的蛋白质到了实验室可能一碰就散架。
一条完整的工具链已经成型
我画一个典型的流程,大家感受一下:
RFdiffusion→生成主链结构
↓
ProteinMPNN→逆向折叠,设计氨基酸序列
↓
AlphaFold3 / OpenFold3→验证折叠结构 + 复合物预测
这个流程的意思是:先用RFdiffusion画出一个蛋白质的"骨架"形状,然后用ProteinMPNN决定骨架上每个位置放什么氨基酸,最后用AlphaFold验证一下这个设计到底能不能真的折叠出来。
你发现没有?AlphaFold在这个流程里的角色,从"主角"变成了"质检员"。这是一个很有意思的角色转换。
Generate Biomedicines、BioNTech这些公司,现在都在扩散模型方向上重兵布局。不是没有道理的——这套工具链的成熟度,已经让"设计蛋白质"从学术玩具变成了工业级工具。
220亿美元,说明什么?
一组数据:AI蛋白质设计相关的BD合作,里程碑金额已经超过220亿美元。
220亿美元。这个数字不是VC在撒钱玩,是大型药企在做真正的商业判断。礼来、罗氏、安进这些巨头,都跟AI蛋白质设计公司签了大单。
他们的逻辑很简单:传统抗体发现、酶工程,周期长、成功率低。如果AI能把设计周期从"几年"压缩到"几周",哪怕只有30%的设计能通过湿实验验证,ROI也是炸裂的。
说到湿实验验证——这就是我要说的那个"鸿沟"了。
那个还没填上的鸿沟
前面说的那些东西,听起来很美对吧?四大引擎、完整工具链、220亿美元押注。
但我要泼一盆冷水。
我第一反应是:这是不是在吹牛?
核心问题:许多在电脑上评分满分的设计,到了实验室,根本折叠不出来,或者表达量极低。
这就是所谓的"验证鸿沟"。
RFdiffusion2说41个案例100%成功率——那是计算层面的成功率。意思是模型能生成结构合理的蛋白质主链。但这个蛋白质丢到真实的细胞环境里,能不能正确折叠?能不能稳定存在?能不能高效表达?有没有免疫原性?
这些问题,AI目前给不了确定答案。
湿实验验证依然不可或缺。而且不是一般的不可或缺——它是最关键的那个环节。没有湿实验反馈,AI模型就是个"自嗨"的设计师,画了一堆漂亮的图纸,但没一个能盖成房子。
我为什么对这个问题特别在意?因为这件事不只发生在蛋白质设计领域。整个AI制药行业,都卡在这一步。
英矽智能的Rentosertib——一个AI发现靶点、AI设计分子的IPF新药——刚刚进入III期临床。这是目前全球范围内,AI原生药企走得最远的临床管线之一。如果III期能成,那就是"AI从设计到临床"这条路的第一个真正意义上的里程碑。
但即使英矽智能,也在加速建湿实验闭环。他们CEO任峰说了一句很实在的话:"垂类模型为AI原生药企争取到的算法优势窗口只有3-5年。"
什么意思?算法会趋同。你现在有的模型优势,别人三五年也能追上。真正的壁垒是什么?是数据闭环——设计、合成、测试、反馈,一轮一轮跑下来,积累出来的那个"know-how"。
和黄医药这些转型药企也在追赶。它们的优势是湿实验能力强、临床经验丰富。AI是它们的工具,不是它们的基因。但工具用得好,有时候比基因更重要。
我的判断
写到这里,我说说自己的看法。
第一,AI蛋白质设计已经过了"能不能做"的阶段。技术上可行,工具链成型,学术圈和工业界都已经验证了。这一步没有争议。
第二,现在进入的是"能不能规模化、能不能通过湿实验验证"的阶段。这才是真正的分水岭。生成成功不等于实验成功,设计漂亮不等于产品可用。220亿美元的BD金额说明资本市场在押注,但真正的验证还在后面。
第三,未来的竞争不在算法本身。算法会趋同——就像大语言模型领域,大家用的transformer架构都差不多。真正的差异在"设计-合成-测试-反馈"的闭环飞轮。谁先跑通这个飞轮,谁的数据质量最高,谁就能建立真正的壁垒。
第四,扩散模型是这场变革的核心引擎。但引擎再好,车还得能上路。从计算到实验、从demo到product,中间那条路可能比所有人想象的都要长。
说到底,AI蛋白质设计这件事,让我想起五年前AlphaFold刚出来的时候。那时候大家也在争论——"预测准了又怎样?能做药吗?"五年后的今天,答案已经很清楚了:预测只是起点,设计才是目的。而从设计到产品之间的路,才是真正考验人的地方。
220亿美元是信任票,但还不是判决书。
真正的判决,要等湿实验的数据一锤定音。
💬 今日互动
你觉得AI蛋白质设计从"demo"到"product"还需要多久?
欢迎留言聊聊你的判断。