ARTICLE · 1156214
AI多肽的10B数据集,真相是没人能替它复核
先说一句不讨喜的话:多肽 AI 公司手里那批数据,越是被写成壁垒,越容易被高估。
10 月 10 日,利太智药(LigIT)的种子轮消息传出来,规模近 5000 万元人民币,讯飞创投与 L2F 光源创业者基金领投,光源资本担任独家财务顾问。这家公司 2026 年 7 月才成立,总部在北京海淀,到消息公开时满打满算不足三个月。
据动脉网旗下 VCBeat 的独家报道,这家公司给自己搭的是「数据、模型、分子」三层结构,最上面那层叫 PepUmi,一个自研的闭源多肽合成数据集,数据量近 10B。
近 5000 万元人民币的种子轮,放在国内 AI 制药早期里算不上大数目。真正有意思的是那个 10B的数据集。多肽这个模态,公开结构数据稀缺是写在每一行行业分析里的老共识,一家成立不足三个月的公司把 10B 挂到自己名下,但这 10B 里成功样本占多少,失败样本占多少,除了它自己,谁有资格打开看一眼。
多肽 AI 公司到底在卖什么
在评价任何一家之前,先把尺子摆出来。多肽 AI 这门生意,能被外部检验的只有三样东西。
第一条叫数据可复核性。不是问数据有多少条,而是问这批数据能不能被第三方用同一套方法重跑一遍,或者至少说清它的构成比例、采集条件和失败样本占比。说不清构成的数据量,是个宣传口径,不是资产。
第二条叫模型的规模效应。真正在走 Scaling Law 的模型,能力得随数据量、参数规模、算力投入线性往外长,并且拿得出一条公开的曲线。曲线拿不出来,「遵循 Scaling Law」就只是一句形容词。
第三条叫闭环的产出口径。72 小时走完设计与合成,产出的是「能被合成的分子」还是「能往临床推的分子」,这是两个完全不同的分母。拿前者去答后者的问题,是整个行业最熟练的一种错位。
这三条不是刁难。我的判断是,它们构成了这个赛道里少数几个能在会议室里当场问、当场验的东西。
三层护城河,哪一层最难验
把利太智药公开的信息按这三条排一遍,层次就出来了。
据中国经济新闻网的报道,PepUni 生成环肽的亲和力确实到了 nM 级,PepMirror 设计的 D 型肽稳定性是常规 L 型的数十倍,部分靶点亲和力到个位数 nM。这些数字单个看都很漂亮,问题在于它们全部是自家平台上跑出来的自家结果。一层比一层更难验,这不是利太智药一个公司的问题。
它恰恰是这个阶段 AI 制药的通用形态:数据层最像护城河,也最不可验;分子层最不像护城河,反而最接近可验。
三类常见手法:把哪一栏悄悄换成了另一栏
手法一,用数据量顶替数据质量。近 10B 是个很有冲击力的数字,但多肽合成的失败样本从来不比成功样本少,而失败样本恰恰是模型真正需要的东西。一家公司如果只报总量不报失败比例,那这 10B 里最有价值的一半可能根本没被收进去。
手法二,用亲和力顶替成药性。有人把一张环肽亲和力表推到我面前,KD 一栏排得很整齐,个位数 nM 那几行还加了粗。我问了一句:这批分子在血浆里能活多久。对面停了两秒,说这个还没测。结合得紧和能在体内存活足够久,中间隔着一整个成药性工程,不是同一个考卷上的题。
手法三,用闭环速度顶替验证深度。据 VCBeat 的报道,利太智药搭了一条 72 小时的生成到合成闭环,覆盖设计、化学合成、生物测试与结构解析,已在多个肿瘤与代谢相关靶点完成验证。这条闭环解决的是「设计出来的东西能不能造出来」,它验证的是工程能力;它不回答「造出来的东西能不能成为药」,那需要体内药效、代谢稳定性和毒理数据。72 小时这个速度值得尊重,但别把它读成疗效信号。
为什么这套说法现在好卖
不是谁在撒谎,是环境在奖励这种表述。
第一重是数据焦虑。据 The Ledger Asia 10 月 7 日的报道,Biohub 牵头的虚拟生物学计划把投入总额推到约 18 亿美元,其中美国能源部在五年内投入超过 5 亿美元用于实验室测量、建模与计算;据科技日报报道,AI 企业与生命科学公司正在把投入往数据生产、实验测量这些上游环节延伸。当整个行业都承认卡在数据上,「我们有一批别人没有的数据」就自动成了最有说服力的句子。
第二重是政策窗口。据《科创板日报》报道,工业和信息化部等十部门印发的《医药工业发展「十五五」规划》提出加快人工智能等新技术赋能药物研发。政策把方向写死了,资本就需要一批能装进这个方向的标的。
第三重是人才溢价。利太智药创始人贾寅君是 2026 年初发表于《科学》的 DrugCLIP 研究的共一第一顺位作者,据公开报道该研究可在 1 分钟内完成千亿规模分子的筛选,速度较传统对接工具提升百万倍;公司核心研发团队清北本博占比达 85%。种子轮定价里,很大一部分买的是这条履历与这支队伍的预期产能,不是任何一项已交付的资产。
三重力量叠在一起,形成一个正反馈:怕错过的人抬高早期估值,估值抬高又吸引更多团队复制同一套三层叙事,而叙事被重复得越多,数据越像护城河。循环到最后,没人再问那个最初的问题。
识别工具:三个问题,好答案和坏答案
这套东西是可以问穿的。把下面三个问题带进会议室,答案质量立刻分层。
坏答案的共同点是换了一个更好听的指标;好答案的共同点是给出了一个可以被下次会议复核的数。我认为,判断标准不在于对方讲得多专业,在于他愿不愿意把自己的数字交给别人验一遍。
谁可能活下来:一个能证伪的时间窗
点名说判断,不点名说态度,都是耍滑头。
利太智药这家公司,按公开信息,多条自研管线处于 HIT-to-lead 阶段,预计 2027 年初产出具备成药潜力的候选化合物。这是它给自己设的一个可证伪的锚,我愿意按这个锚去等。我不认为三个月时间足够把一批数据变成壁垒,但我认可把「2027 年初出候选化合物」这句话公开写出来的做法,因为它给了外界一个能打分的日子。它走「平台加管线」双引擎,短期靠模型授权、API 服务与联合研发变现,长期自己做肿瘤、自身免疫、代谢三个方向的管线,这个结构在国内早期公司里是清醒的。
放到同一时间窗里对照,另两家的选择更极端。据 WhiteLab Genomics 官网公告,这家巴黎公司 10 月 6 日完成 2600 万美元 B 轮,把钱直接压在体内验证上,用 AI 设计的 AAV 去撞血脑屏障;据 Brief 报道,巴黎的 Rivercell 在 10 月 7 日带着 2200 万欧元种子轮出隐身,钱花在自建数据生成平台上。
三条路指向同一件事:这个阶段真正稀缺的不是模型,是可复核的湿实验产出。方向性判断就一句:数据生产型看多,纯模型叙事型看空。谁先把自家数据交出去被别人验一遍,谁才配谈护城河。
参考资料
动脉网旗下 VCBeat:关于利太智药种子轮与三层技术体系的独家报道(2026 年 10 月 10 日) 中国经济新闻网:利太智药完成近 5000 万元人民币种子轮,介绍 PepUmi、PepUni、PepMirror 三层体系(2026 年 10 月 10 日) 《科创板日报》:利太智药种子轮融资与十五五规划、AI 制药市场规模预测(2026 年 10 月 10 日) 科技日报:AI 企业向生物学研究链条上游延伸,虚拟细胞数据需求(2026 年 10 月 10 日) WhiteLab Genomics 官网新闻室:2600 万美元 B 轮与 ALFRED 平台体内验证进展(2026 年 10 月 6 日) The Ledger Asia:约 18 亿美元 AI 生物学联盟的资金构成(2026 年 10 月 7 日)