ARTICLE · 1102474
44.8GB的安装包,装着AI制药的全部真相
对于AI制药的agent,我做判断的习惯是先问一句:把AI模块关掉,剩下的部分还能不能自己跑通。我跟进过的项目里,号称用AI agent全流程做药的不在少数,能当场做对照演示的,一家都没有。
2026年9月22日,bioRxiv上线一篇预印本,题目叫《Agentic campaign control for high-throughput de novo binder design》。作者四人:Minkyu Jeon、Jinyeop Song、Jina Kim,通讯作者Ellen D. Zhong,实验室代号ml-struct-bio。代码当天就开源了。
两天后,一个叫AGI Hunt的栏目把它读成「LLM agent当科研实验指挥官」路线在AI4Science的扎实落地案例。
但其实,这篇论文最值钱的地方,恰恰是它承认LLM不能自主做药。
它把agent关在确定性代码里,每一步提议都要被校验、排队、留痕。它是今年最诚实的一篇agent论文,诚实到让所有讲「自主」的故事都难办。
我问的每个创始人都答不上这个问题
先说清楚什么叫agent自主做药。市面上常见的话术是:我们有一个AI,它自己读靶点信息,自己设计分子,自己评估,自己迭代,人只负责最后签字。这套话在BD材料里、在融资路演里、在媒体通稿里,版本越来越多。
我的标准很简单,就一个问题:把你们那个LLM关掉,流水线还转不转。
这个问题我没有一次得到干净回答。常见的反应是绕到数据量、模型参数、合作背书上。有家做双抗的公司在闭门会上给我看他们的「自主设计平台」演示,我问他关掉大模型会怎样,他说那就是一套脚本。我说那它自主的部分是什么,他没接话。散场时他的屏幕还停在演示界面,循环播放着那张架构图。我不怪他,这套叙事是市场给的补贴,谁不讲谁吃亏。
T-REX不一样的地方在于,它把这个问题写进了架构,还写进了论文,并且用一行行可审计的日志回答了它。
定义与标准:三个信号判断一个AI做药演示是真是假
不是所有人都有时间读预印本和代码。我提炼三个可操作的判断信号,下次再看到「agent自主制药」的发布,照着问一遍。
第一个信号,LLM的输出有没有被确定性代码校验。
如果演示里LLM说什么系统就做什么,那是演示,不是系统。真实系统里LLM会出错:它会提出不合法的操作、会重复已经失败过的设置、会在不该停的时候停。一个敢说自主的系统,必须有一层代码挡在LLM和 GPU 之间,把不合法的动作直接扔回去。T-REX的README写得很直白:Planner和Supervisor两层LLM负责提出和排序任务,确定性代码负责校验这些任务,并管理生成、重设计和评估。
第二个信号,决策的颗粒度。
如果LLM每一个分子都决策一次,那不是智能,是阻塞。T-REX的决策是campaign级的:它在一个设计战役里,根据累积结果决定下一批是救援有希望的结构(Rescue)、换设置重试(Explore),还是沿着有效的路线加码(eXploit)。这是一个调度器该有的决策频率,不是科学家做实验的频率。
第三个信号,也是最关键的一个,关掉agent,性能掉多少。
这一条很多发布根本不提供。T-REX提供了完整的对照:它把六个生成家族、ProteinMPNN重设计、AF2评估都注册成可调度的动作,agent做的是在它们之间分配算力。baseline就是这些模型自己跑,T-REX赢的是结构多样hit的吞吐量。换句话说,模型还是那些模型,换一种调度就赢,说明瓶颈不在生成能力,在算力怎么花。
手法拆解:真相是LLM只负责提议
论文里最有意思的,是它的安装文档。想要复现,你得先经历这些。
克隆仓库,装一个pinned的uv工具链,然后跑一条setup命令。这条命令会检出Complexa、BindCraft、BoltzGen三个后端的记录版本,从网盘下载44.8GB的资产压缩包,解压后约52GB,磁盘占用至少110GB。它要从官方wheel源下载PyRosetta,要构建指定版本的Foldseek和MMseqs2。它要建四套互相不兼容的Python环境,因为Complexa、BindCraft、BoltzGen和vLLM对Python、JAX、PyTorch版本的要求互不相容。它还要对checkpoint逐个做SHA256校验。
跑之前还有一道fail-closed预检,叫trex check:检查靶点身份和热点残基、检查checkpoint文件、检查所有后端可执行文件、检查Git版本号、检查BindCraft的生产补丁、检查Foldseek和MMseqs2的版本。任何一项不过,提交直接停止。
这套工程量说明什么?说明agent是这套系统里最不稀缺的部分。真正稀缺的是把六个生成家族、四套环境、几十个checkpoint、Slurm队列和H100显卡拼成一条稳定流水线的工程能力。agent做的,是在这条流水线建成之后,决定下一份算力发给谁。
还有一个细节值得单独说。T-REX跑在Slurm集群上,README给的示例是Princeton的Della H100节点。LLM服务器跑在GPU 0上,其余显卡才跑分子设计任务。如果你申请四块GPU,一块喂给本地部署的Qwen模型,三块干活。也就是说,这套「自主智能」的大脑,是一个跑在本地的开源中等规模模型,不是最贵的那几个API。大脑选便宜的那个,恰恰说明它干的活不需要最聪明的脑子。
再往上一层看,用户要做的决定只有四个:靶点、单节点显卡数量、战役时长、输出目录,剩下的全交给setup、init、check、submit四条命令。跑完后,归档目录按类型分好:hypothesis_cards记假设的每次演进,action_candidates记候选动作,supervisor_decisions记监督层的拍板,llm_call_records把每一次LLM调用留底,launch_decisions和dispatch_records记实际派发。
想复盘agent哪一步判断错了,能一路追到具体那一次调用。这套留痕密度,我在这行见过的公司演示里一次都没有。顺带一句,setup命令本身是可恢复的,网络断了重跑同一条命令,它跳过已完成的阶段从断点继续。这种工程自觉,比论文里任何一句「autonomous」都更能说明它是为真实集群写的东西。
谎言的构造:叙事为什么总跑到模型前面
讲回媒体那头的解读。AGI Hunt把T-REX叫做「LLM agent当科研实验指挥官」的扎实落地。这个说法不算错,但它会诱导读者关注错误的东西。
叙事跑偏有三个原因。
第一,模型层的故事讲完了。
Complexa、BindCraft、BoltzGen这些生成模型,能力曲线在趋同,谁也不比谁强一个量级。在这个阶段,你能讲的新故事只剩「我怎么用它们」。编排层是唯一还有增量可讲的地方,于是所有叙事都往这里堆。
第二,demo比论文好传播。
一个会自己跑实验的AI,比一个会调度队列的AI好讲一万倍。但调度队列才是T-REX的实际贡献。它把蛋白质设计建模成在线分配问题:在异构工具之间动态决定跑哪个工具、用什么设置。这个问题的价值不打折,只是它不性感。
第三,利益结构需要这个叙事。
预印本的竞争利益声明写得很清楚:Ellen D. Zhong持有Generate Biomedicines的股权,并担任Deep Apple Therapeutics和Chan Zuckerberg Imaging Institute的科学顾问。这不是污点,披露本身是加分项,很多论文连这都做不到。但它意味着,这套编排框架的商业化路径在论文发表之前就已经有了指向。开源T-REX,开的是调度器;数据、管线、持股关系,一样都没开。社区贡献的是「怎么花GPU更划算」的know-how,闭环留在持有资产的一方。
识别工具:好答案和坏答案的对照表
直接给工具。下次碰到「AI agent做药」的发布,对号入座。
好答案长这样:论文提供关掉agent的对照实验,并写明性能差多少;公开每次LLM调用的决策日志,T-REX的归档里hypothesis_cards、action_candidates、supervisor_decisions、llm_call_records、launch_decisions一应俱全,每次调度都可回溯;明确写出agent不能做什么,T-REX自己就声明确定性控制器负责可靠性和调度,没把可靠性归功于LLM;贴出部署门槛,四套环境、110GB磁盘、H100集群,让读者自己判断这玩意儿能不能搬回自己公司。
坏答案长这样:只放演示视频,不放对照数据;性能数字全是「相比传统方法提升N倍」,baseline含糊;一句「自主决策」覆盖全部环节,问就是商业机密;对算力成本、环境依赖、复现路径只字不提。这种发布,我一般翻到第二页就关了。
两张表压缩成一句话:敢把决策日志亮出来的才算系统,只讲故事的不算。
还有一个容易混淆的点。吞吐量是计算指标,不是分子。T-REX在七个靶点(CD45、BET、CBAGo、HER2、新冠病毒RBD、PD-L1、IL-7R)上拿到的是结构上多样的hit数量,高于所有baseline。这些hit通过了计算评估,论文与代码仓库里没有报告任何一条经过SPR、BLI或者湿实验验证。这不是批评,计算研究本来就该这样收尾,这是提醒读新闻的人:从「计算指标领先」到「做出能吃药的分子」,中间隔着整个药物开发最贵的那一段。
谁能活下来:下一个战场在编排层
我的判断是,未来两年,蛋白质设计乃至整个AI做药领域的竞争点,会从「谁的模型更好」转到「谁更会花算力」。
理由有三条。模型在趋同,六个生成家族的能力差距不足以解释结果差异,T-REX换调度就赢了所有baseline,这是直接的证据。算力成本是真实约束,一次设计战役的时长是用户自己填的(README的示例是48小时四块GPU),在有限预算下怎么分配,是真问题。编排能力可累积,它不像模型权重那样靠一次训练定生死,它靠工程实践和对工具性格的理解,这是企业能攒、别人拿不走的东西。
这个判断有一个可证伪的检验点:如果明年这个时候,蛋白设计领域的论文开始把编排策略当主结果汇报,而不是塞进方法附录里当配角,说明编排层确实成了主战场。
幸存者会是谁。一种是持有专有数据与管线、同时自建编排层的平台型公司,它们把开源编排器当基础设施用,自己的资产不开放。一种是工具层供应商,把复杂环境管理做成服务,帮药企搞定四套Python环境、Slurm队列和checkpoint校验这摊事,赚的是过路费。单纯讲agent故事、自己没有管线也没有工程能力的公司,这一轮会被筛掉。国内能接住这波红利的,是已经租下集群、有工程团队攒过环境管理经验的团队;纯靠调API做集成的,议价空间会被越压越薄。
附带一个观察。T-REX把LLM服务器放在GPU 0、用本地Qwen,这个设计会被更多团队抄。当编排成为主战场,最贵的模型不是必需品,够用的脑子加更聪明的调度,才是性价比正确的组合。
时间窗和一句狠话
最后给时间判断。我认为2026年底到2027年,编排层工具会从论文走进公司的采购清单,而「agent自主做药」的demo灾难会集中爆发一批。判断标准已经给出去了:关掉LLM,它还转不转。再给两个概率自估:编排策略成为蛋白设计论文主结果、明年内见到三篇以上,六成;「agent自主做药」这套说法在明年下半年从融资材料里退潮,五成。
一句狠话收尾:凡是不能关掉LLM做对照的自主制药故事,都别信。这篇论文把agent关进了确定性代码,把每一次决策写进了日志,把部署门槛写得一清二楚,最后告诉你它赢在调度。它什么自主的故事都没讲,却比所有讲自主故事的都可信。
参考资料
Minkyu Jeon, Jinyeop Song, Jina Kim, Ellen D. Zhong. Agentic campaign control for high-throughput de novo binder design. bioRxiv, 2026-09-22. DOI: 10.64898/2026.09.22.753604(预印本全文与竞争利益声明,一手) ml-struct-bio/T-REX 代码仓库,GitHub,最后提交2026-09-27。README与安装文档(架构、44.8GB资产包、四套环境、fail-closed预检、GPU 0运行本地Qwen、审计日志结构,一手) AGI Hunt栏目对T-REX的解读(「LLM agent当科研实验指挥官」叙事出处,二手解读)