夜雨聆风学习资料网

ARTICLE · 1102474

44.8GB的安装包,装着AI制药的全部真相

44.8GB的安装包,装着AI制药的全部真相

对于AI制药的agent,我做判断的习惯是先问一句⁠:把AI模块关掉⁠,剩下的部分还能不能自己跑通⁠。我跟进过的项目里,号称用AI agent全流程做药的不在少数⁠,能当场做对照演示的⁠,一家都没有⁠。

2026年9月22日⁠,bioRxiv上线一篇预印本⁠,题目叫《Agentic campaign control for high-throughput de novo binder design⁠》。作者四人⁠:Minkyu Jeon⁠、Jinyeop Song⁠、Jina Kim⁠,通讯作者Ellen D. Zhong⁠,实验室代号ml-struct-bio⁠。代码当天就开源了⁠。

两天后⁠,一个叫AGI Hunt的栏目把它读成「LLM agent当科研实验指挥官⁠」路线在AI4Science的扎实落地案例⁠。

但其实,这篇论文最值钱的地方⁠,恰恰是它承认LLM不能自主做药⁠。

它把agent关在确定性代码里⁠,每一步提议都要被校验⁠、排队⁠、留痕⁠。它是今年最诚实的一篇agent论文⁠,诚实到让所有讲「自主⁠」的故事都难办⁠。

我问的每个创始人都答不上这个问题

先说清楚什么叫agent自主做药⁠。市面上常见的话术是⁠:我们有一个AI⁠,它自己读靶点信息⁠,自己设计分子⁠,自己评估⁠,自己迭代⁠,人只负责最后签字⁠。这套话在BD材料里⁠、在融资路演里⁠、在媒体通稿里⁠,版本越来越多⁠。

我的标准很简单⁠,就一个问题⁠:把你们那个LLM关掉⁠,流水线还转不转⁠。

这个问题我没有一次得到干净回答⁠。常见的反应是绕到数据量⁠、模型参数⁠、合作背书上⁠。有家做双抗的公司在闭门会上给我看他们的「自主设计平台⁠」演示⁠,我问他关掉大模型会怎样⁠,他说那就是一套脚本⁠。我说那它自主的部分是什么⁠,他没接话⁠。散场时他的屏幕还停在演示界面⁠,循环播放着那张架构图⁠。我不怪他⁠,这套叙事是市场给的补贴⁠,谁不讲谁吃亏⁠。

T-REX不一样的地方在于⁠,它把这个问题写进了架构⁠,还写进了论文⁠,并且用一行行可审计的日志回答了它⁠。

定义与标准⁠:三个信号判断一个AI做药演示是真是假

不是所有人都有时间读预印本和代码⁠。我提炼三个可操作的判断信号⁠,下次再看到「agent自主制药⁠」的发布⁠,照着问一遍⁠。

第一个信号⁠,LLM的输出有没有被确定性代码校验⁠。

如果演示里LLM说什么系统就做什么⁠,那是演示⁠,不是系统⁠。真实系统里LLM会出错⁠:它会提出不合法的操作⁠、会重复已经失败过的设置⁠、会在不该停的时候停⁠。一个敢说自主的系统⁠,必须有一层代码挡在LLM和 GPU 之间⁠,把不合法的动作直接扔回去⁠。T-REX的README写得很直白⁠:Planner和Supervisor两层LLM负责提出和排序任务⁠,确定性代码负责校验这些任务⁠,并管理生成⁠、重设计和评估⁠。

第二个信号⁠,决策的颗粒度⁠。

如果LLM每一个分子都决策一次⁠,那不是智能⁠,是阻塞⁠。T-REX的决策是campaign级的⁠:它在一个设计战役里⁠,根据累积结果决定下一批是救援有希望的结构(Rescue⁠)、换设置重试(Explore⁠),还是沿着有效的路线加码(eXploit⁠)。这是一个调度器该有的决策频率⁠,不是科学家做实验的频率⁠。

第三个信号⁠,也是最关键的一个⁠,关掉agent⁠,性能掉多少⁠。

这一条很多发布根本不提供⁠。T-REX提供了完整的对照⁠:它把六个生成家族⁠、ProteinMPNN重设计⁠、AF2评估都注册成可调度的动作⁠,agent做的是在它们之间分配算力⁠。baseline就是这些模型自己跑⁠,T-REX赢的是结构多样hit的吞吐量⁠。换句话说⁠,模型还是那些模型⁠,换一种调度就赢⁠,说明瓶颈不在生成能力⁠,在算力怎么花⁠。

手法拆解⁠:真相是LLM只负责提议

论文里最有意思的⁠,是它的安装文档⁠。想要复现⁠,你得先经历这些⁠。

克隆仓库⁠,装一个pinned的uv工具链⁠,然后跑一条setup命令⁠。这条命令会检出Complexa⁠、BindCraft⁠、BoltzGen三个后端的记录版本⁠,从网盘下载44.8GB的资产压缩包⁠,解压后约52GB⁠,磁盘占用至少110GB⁠。它要从官方wheel源下载PyRosetta⁠,要构建指定版本的Foldseek和MMseqs2⁠。它要建四套互相不兼容的Python环境⁠,因为Complexa⁠、BindCraft⁠、BoltzGen和vLLM对Python⁠、JAX⁠、PyTorch版本的要求互不相容⁠。它还要对checkpoint逐个做SHA256校验⁠。

跑之前还有一道fail-closed预检⁠,叫trex check⁠:检查靶点身份和热点残基⁠、检查checkpoint文件⁠、检查所有后端可执行文件⁠、检查Git版本号⁠、检查BindCraft的生产补丁⁠、检查Foldseek和MMseqs2的版本⁠。任何一项不过⁠,提交直接停止⁠。

这套工程量说明什么⁠?说明agent是这套系统里最不稀缺的部分⁠。真正稀缺的是把六个生成家族⁠、四套环境⁠、几十个checkpoint⁠、Slurm队列和H100显卡拼成一条稳定流水线的工程能力⁠。agent做的⁠,是在这条流水线建成之后⁠,决定下一份算力发给谁⁠。

还有一个细节值得单独说⁠。T-REX跑在Slurm集群上⁠,README给的示例是Princeton的Della H100节点⁠。LLM服务器跑在GPU 0上⁠,其余显卡才跑分子设计任务⁠。如果你申请四块GPU⁠,一块喂给本地部署的Qwen模型⁠,三块干活⁠。也就是说⁠,这套「自主智能⁠」的大脑⁠,是一个跑在本地的开源中等规模模型⁠,不是最贵的那几个API⁠。大脑选便宜的那个⁠,恰恰说明它干的活不需要最聪明的脑子⁠。

再往上一层看⁠,用户要做的决定只有四个⁠:靶点⁠、单节点显卡数量⁠、战役时长⁠、输出目录⁠,剩下的全交给setup⁠、init⁠、check⁠、submit四条命令⁠。跑完后⁠,归档目录按类型分好⁠:hypothesis_cards记假设的每次演进⁠,action_candidates记候选动作⁠,supervisor_decisions记监督层的拍板⁠,llm_call_records把每一次LLM调用留底⁠,launch_decisions和dispatch_records记实际派发⁠。

想复盘agent哪一步判断错了⁠,能一路追到具体那一次调用⁠。这套留痕密度⁠,我在这行见过的公司演示里一次都没有⁠。顺带一句⁠,setup命令本身是可恢复的⁠,网络断了重跑同一条命令⁠,它跳过已完成的阶段从断点继续⁠。这种工程自觉⁠,比论文里任何一句「autonomous⁠」都更能说明它是为真实集群写的东西⁠。

谎言的构造⁠:叙事为什么总跑到模型前面

讲回媒体那头的解读⁠。AGI Hunt把T-REX叫做「LLM agent当科研实验指挥官⁠」的扎实落地⁠。这个说法不算错⁠,但它会诱导读者关注错误的东西⁠。

叙事跑偏有三个原因⁠。

第一⁠,模型层的故事讲完了。⁠

Complexa⁠、BindCraft⁠、BoltzGen这些生成模型⁠,能力曲线在趋同⁠,谁也不比谁强一个量级⁠。在这个阶段⁠,你能讲的新故事只剩「我怎么用它们⁠」。编排层是唯一还有增量可讲的地方⁠,于是所有叙事都往这里堆⁠。

第二⁠,demo比论文好传播⁠。

一个会自己跑实验的AI⁠,比一个会调度队列的AI好讲一万倍⁠。但调度队列才是T-REX的实际贡献⁠。它把蛋白质设计建模成在线分配问题⁠:在异构工具之间动态决定跑哪个工具⁠、用什么设置⁠。这个问题的价值不打折⁠,只是它不性感⁠。

第三⁠,利益结构需要这个叙事⁠。

预印本的竞争利益声明写得很清楚⁠:Ellen D. Zhong持有Generate Biomedicines的股权⁠,并担任Deep Apple Therapeutics和Chan Zuckerberg Imaging Institute的科学顾问⁠。这不是污点⁠,披露本身是加分项⁠,很多论文连这都做不到⁠。但它意味着⁠,这套编排框架的商业化路径在论文发表之前就已经有了指向⁠。开源T-REX⁠,开的是调度器⁠;数据⁠、管线⁠、持股关系⁠,一样都没开⁠。社区贡献的是「怎么花GPU更划算⁠」的know-how⁠,闭环留在持有资产的一方⁠。

识别工具⁠:好答案和坏答案的对照表

直接给工具⁠。下次碰到「AI agent做药⁠」的发布⁠,对号入座⁠。

好答案长这样⁠:论文提供关掉agent的对照实验⁠,并写明性能差多少⁠;公开每次LLM调用的决策日志⁠,T-REX的归档里hypothesis_cards⁠、action_candidates⁠、supervisor_decisions⁠、llm_call_records⁠、launch_decisions一应俱全⁠,每次调度都可回溯⁠;明确写出agent不能做什么⁠,T-REX自己就声明确定性控制器负责可靠性和调度⁠,没把可靠性归功于LLM⁠;贴出部署门槛⁠,四套环境⁠、110GB磁盘⁠、H100集群⁠,让读者自己判断这玩意儿能不能搬回自己公司⁠。

坏答案长这样⁠:只放演示视频⁠,不放对照数据⁠;性能数字全是「相比传统方法提升N倍⁠」,baseline含糊⁠;一句「自主决策⁠」覆盖全部环节⁠,问就是商业机密⁠;对算力成本⁠、环境依赖⁠、复现路径只字不提⁠。这种发布⁠,我一般翻到第二页就关了⁠。

两张表压缩成一句话⁠:敢把决策日志亮出来的才算系统⁠,只讲故事的不算⁠。

还有一个容易混淆的点⁠。吞吐量是计算指标⁠,不是分子⁠。T-REX在七个靶点(CD45⁠、BET⁠、CBAGo⁠、HER2⁠、新冠病毒RBD⁠、PD-L1⁠、IL-7R⁠)上拿到的是结构上多样的hit数量⁠,高于所有baseline⁠。这些hit通过了计算评估⁠,论文与代码仓库里没有报告任何一条经过SPR⁠、BLI或者湿实验验证⁠。这不是批评⁠,计算研究本来就该这样收尾⁠,这是提醒读新闻的人⁠:从「计算指标领先⁠」到「做出能吃药的分子⁠」,中间隔着整个药物开发最贵的那一段⁠。

谁能活下来⁠:下一个战场在编排层

我的判断是⁠,未来两年⁠,蛋白质设计乃至整个AI做药领域的竞争点⁠,会从「谁的模型更好⁠」转到「谁更会花算力⁠」。

理由有三条⁠。模型在趋同⁠,六个生成家族的能力差距不足以解释结果差异⁠,T-REX换调度就赢了所有baseline⁠,这是直接的证据⁠。算力成本是真实约束⁠,一次设计战役的时长是用户自己填的(README的示例是48小时四块GPU⁠),在有限预算下怎么分配⁠,是真问题⁠。编排能力可累积⁠,它不像模型权重那样靠一次训练定生死⁠,它靠工程实践和对工具性格的理解⁠,这是企业能攒⁠、别人拿不走的东西⁠。

这个判断有一个可证伪的检验点⁠:如果明年这个时候⁠,蛋白设计领域的论文开始把编排策略当主结果汇报⁠,而不是塞进方法附录里当配角⁠,说明编排层确实成了主战场⁠。

幸存者会是谁⁠。一种是持有专有数据与管线⁠、同时自建编排层的平台型公司⁠,它们把开源编排器当基础设施用⁠,自己的资产不开放⁠。一种是工具层供应商⁠,把复杂环境管理做成服务⁠,帮药企搞定四套Python环境⁠、Slurm队列和checkpoint校验这摊事⁠,赚的是过路费⁠。单纯讲agent故事⁠、自己没有管线也没有工程能力的公司⁠,这一轮会被筛掉⁠。国内能接住这波红利的⁠,是已经租下集群⁠、有工程团队攒过环境管理经验的团队⁠;纯靠调API做集成的⁠,议价空间会被越压越薄⁠。

附带一个观察⁠。T-REX把LLM服务器放在GPU 0⁠、用本地Qwen⁠,这个设计会被更多团队抄⁠。当编排成为主战场⁠,最贵的模型不是必需品⁠,够用的脑子加更聪明的调度⁠,才是性价比正确的组合⁠。

时间窗和一句狠话

最后给时间判断⁠。我认为2026年底到2027年⁠,编排层工具会从论文走进公司的采购清单⁠,而「agent自主做药⁠」的demo灾难会集中爆发一批⁠。判断标准已经给出去了⁠:关掉LLM⁠,它还转不转⁠。再给两个概率自估⁠:编排策略成为蛋白设计论文主结果⁠、明年内见到三篇以上⁠,六成⁠;「agent自主做药⁠」这套说法在明年下半年从融资材料里退潮⁠,五成⁠。

一句狠话收尾⁠:凡是不能关掉LLM做对照的自主制药故事⁠,都别信⁠。这篇论文把agent关进了确定性代码⁠,把每一次决策写进了日志⁠,把部署门槛写得一清二楚⁠,最后告诉你它赢在调度⁠。它什么自主的故事都没讲⁠,却比所有讲自主故事的都可信⁠。

参考资料

  1. Minkyu Jeon, Jinyeop Song, Jina Kim, Ellen D. Zhong. Agentic campaign control for high-throughput de novo binder design. bioRxiv, 2026-09-22. DOI: 10.64898/2026.09.22.753604(预印本全文与竞争利益声明⁠,一手⁠)
  2. ml-struct-bio/T-REX 代码仓库⁠,GitHub⁠,最后提交2026-09-27⁠。README与安装文档(架构⁠、44.8GB资产包⁠、四套环境⁠、fail-closed预检⁠、GPU 0运行本地Qwen⁠、审计日志结构⁠,一手⁠)
  3. AGI Hunt栏目对T-REX的解读(「LLM agent当科研实验指挥官⁠」叙事出处⁠,二手解读⁠)

相关学习资料